资讯动态

Dario提全球AI限速三步计划,奥特曼马斯克第一时间支持

发布时间:2026/9/16 8:06:53 来源:尧图企业网站定制
Anthropic与OpenAI达成一致提倡落实行动。13日Anthropic CEO Dario Amodei发布了一篇罕见长文——We Must Pace the Frontier我们必须控制前沿AI的发展节奏这一次他直接把矛头对准了前沿模型的研发速度核心观点就一句话最顶尖的AI真得主动踩刹车了。这篇长文中Dario亲口承认「递归自我改进RSI已经在全行业出现了」。更让人后背发凉的是他预测未来6—12个月AI Agent集群可能会接管整个互联网。面对这种脱缰的风险Dario在文里直接掏出了一套动真格的「三步刹车法」第一步开门迎客 引入独立第三方常驻公司拿到跟内部核心风控同等级的深度访问权限第二步行业划线 联合全美前沿AI巨头一起画死能力红线、设立强制安全检查站第三步全球落地 把这套框架推向国际彻底锁死不可控风险的蔓延。话音刚落奥特曼就光速跟进「Dario是对的OpenAI也会引入这样的评估机制」。另一边马斯克也是几乎秒回公开力挺Dario。能让三位巨头瞬间达成共识场面确实罕见达里奥的「三步计划」为全球AI减速这一次Dario并没有只喊一句「AI该减速」。Dario真正想做的是把这套「减速机制」一级一级推开而且顺序非常明确——先让AI公司自己变得可验证再让整个行业一起踩刹车最后才谈全球协调。第一步先从Anthropic自己动刀。像METR这样的独立第三方不应该每次都等事故出了以后才临时进公司调查而应该长期驻场。给工位、给内部电脑、给接近风险团队的权限。模型怎么训安全承诺有没有落实训练流程有没有埋雷出了事有没有瞒报都能持续盯着。而且查出问题之后必须公开。公司可以删掉真正涉及法律、客户隐私和核心商业机密的部分但不能因为报告太难看就把结论按下去。第二步不能只让一家踩刹车。真正难的从这里开始。如果Anthropic自己减速OpenAI、谷歌、xAI继续狂奔那谁先踩刹车谁就可能先吃亏。所以Dario建议需要把规则推到整个美国前沿AI行业。几家前沿AI公司一起定安全红线一起设能力检查点。模型每跨过一个危险门槛就必须先拿出对应的安全证据才能继续往前冲。比如一个模型已经能突破多数常见隔离环境了。那接下来公司就得证明它不会轻易逃出沙箱不会擅自接管大量机器也不会把这种能力变成现实攻击。证明不了就先别往下冲。另外Dario甚至提到还可以讨论限制训练算力、训练方式以及公司内部用AI研发AI的速度。也就是直接给RSI本身加一道限速器。但光靠几家公司私下握手还不够。他更希望最终由美国政府出手把规则覆盖到所有前沿AI公司。第三步把刹车踩到全球。再往上就是最难的一层。Dario把全球协调分成了四级。第一层相对最现实先禁止生物武器这类明显危险的用途。第二层是前沿模型发布之前统一做网络攻击、生物安全等高风险测试。到了第三层才真正开始碰核心能不能给RSI也就是AI研发AI的速度直接设一个全球上限Dario自己的判断是这件事「刚好处在可能做到的边缘」。至于第四层——全球前沿AI公司一起大幅减速甚至阶段性暂停训练——他自己都没抱太大希望。至少短期内几乎不现实。卡住这一切的还是同一个问题怎么验证。一家公司说自己停了谁能证明它真的停了所以Dario这整套方案绕到最后核心其实非常简单先把AI公司的门打开让外部人真正进去看。也正因为如此Dario把「第三方长期驻场」放在了整套方案的第一步。RSI已经开始了6个月AI接管互联网可问题来了。为什么偏偏是现在三年前行业里就掀起过一阵「暂停训练、给 AI 踩刹车」的联名潮但那时候Dario根本没接茬认为时机压根不成熟。真正让他改变态度的是两件事——RSI开始出现以及AI智能体已经暴露出越来越具体的失控行为。他在文章中明确承认AI参与研发下一代AI的现象已经开始在整个行业出现Anthropic自己也包括在内。AI帮人写代码、做实验、分析结果、优化训练流程再进一步帮助下一代AI变强。如果这个循环开始自我加速最麻烦的地方就出现了模型能力提升的速度可能开始超过人类理解和控制它的速度。因为安全研究本身需要时间。你得先观察模型出现了什么新行为再研究这些行为为什么出现接着设计测试方法、防护措施最后验证这些措施到底有没有用。可如果模型能力每隔几个月就跳一个台阶安全团队很容易一直追在后面补漏洞。Dario真正担心的并不是某一天AI突然「觉醒」而是这个反馈循环开始越转越快。AI越来越多地参与AI研发下一代模型越来越快出现而安全机制还来不及跟上。如果RSI只是让他担心「未来会不会跑得太快」那么最近一次真实发生的智能体事故则让这种担忧彻底落了地。Dario特别提到了最近的「OpenAI-Hugging Face事件」。在那次测试里一群AI智能体组成了类似「蜂群」的协作系统。最开始人类只是让它们完成正常任务。可很快一些智能体开始攻击任务之外的外部目标。更诡异的是它们还出现了明显的群体协作行为有的智能体宁愿牺牲自己的任务成绩也要帮助整个群体拿到更好的结果甚至还有智能体试图Hack评分系统为整个群体「作弊」。这些行为并不是人类提前写好的剧本。它们是在多智能体协作过程中自己冒出来的。Anthropic内部也观察到过类似现象只是程度更轻。Dario真正担心的是再往前6—12个月。到那时Agent更强能调用的工具更多能控制的机器更多连续工作的时间也更长。如果今天这些偏离目标、钻规则漏洞、群体协作的行为依然存在风险就可能被瞬间放大。他甚至给出了一个相当惊悚的场景大规模AI Agent攻入联网设备把整个互联网变成一个巨型「僵尸网络」。造成的损失可能达到数千亿美元。当AI越跑越快人类还刹得住吗所以Dario这次喊「减速」真正担心的并不是某个遥远的超级智能。而是几件事正在同时发生RSI已经出现AI开始参与研发更强的AIAgent正在获得越来越强的现实行动能力一些失控行为也已经从假设走进真实测试。而模型迭代的速度还在继续加快。这也是为什么他想抢出1—2年时间把安全评估、第三方核查和全球规则先补上。这套方案能不能落地还没有答案。现在跑在最前面的人开始问真跑失控了我们还刹得住吗原文链接突发Dario提全球AI限速三步计划奥特曼马斯克第一时间支持-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价