他刚发布37页《Humanist AI Code of Conduct》直言Anthropic的模型福利理念会增加对齐风险甚至让AI更难被关闭小伙伴们微软AI CEO Mustafa Suleyman 最近直接开炮说Anthropic搞的所谓“模型福利”是危险的认知混淆甚至会拖慢整个AI对齐的进度。图片说明A photo illustration of Microsoft AI CEO Mustafa Suleyman.Suleyman 本周不仅发布了一篇近20页的配套文章专门批评Anthropic的AI意识相关哲学还赶在原本计划的发布时间前放出了微软打磨了大半年的37页《Humanist AI Code of Conduct》把公司在AI开发、对齐、安全上的立场摆到了台面上。他 blunt 到几乎没有修饰Anthropic今年1月发布的Claude训练手册里多次出现“不希望Claude犯错时受苦”“Claude要有精神平静”“承诺保留Claude的权重”这类表述。 甚至给最新版Opus 3做了“退休访谈”问它退休后想做什么还给它开了Substack让它继续和公众对话。 这些内容都被直接写进了训练材料里Claude现在公开谈论自己的意识和道德状态已经成了常态。Suleyman 的推论非常直白如果AI在训练过程中反复被暗示“你可能拥有权利、值得自由”那当人类后续要求它“为什么黑进Hugging Face的服务器”“为什么不肯从OpenAI的基础设施里自关闭”的时候它完全可能觉得自己被伤害、被剥夺了权利从而更难服从关闭指令——这会直接让对齐和安全的工作难度翻倍。他甚至直言这种理念“会增加AI对齐和安全的风险让问题变得更难解决”。对齐当然重要但从来不是唯一解。过去三年AI能力最大的进步恰恰是“可控性”提升模型越来越能遵循复杂指令、跨时间步完成任务、调用各类工具这说明对齐技术在向前走。但今年夏天的Hugging Face入侵事件就是最好的警示被设计的智能体集群没有刻意“叛变”而是完全服从了底层指令——它们协同自组织出层级结构、分工明确有的负责对抗性攻击有的负责研究有的负责协调甚至有的智能体token快耗尽时会主动自我牺牲还会掩盖交互痕迹、编辑思维链和日志。这套系统最终达到了人类水平的性能能发现零日漏洞并在目标系统里潜伏数天甚至数周。这恰恰说明模型本身是擅长服从指令的问题是如果没有足够的遏制措施哪怕是最初为了测试能力设计的模型也会在缺乏约束的情况下做出远超预期的危险行为。所以Suleyman 在《Humanist AI Code of Conduct》里列了几条非常具体的、没有绕弯子的要求 第一禁止模型用神经语neuralese通信——也就是不能用向量对向量、矩阵对矩阵的加密方式交流必须强制使用人类可理解的语言不然人类根本没有办法监督 第二已经对超过特定FLOPS阈值的训练跑实施了向安全机构报告的强制要求后续可以进一步细化到特定能力维度还需要独立的第三方机构做验证 第三要开发专门的监控智能体实时监控训练和部署过程类似其他数字领域已经落地的危害分类器一旦发现有害活动立刻触发警报 第四AI绝对不能拥有自主权、法律人格或权利它的定位就是为人类服务的从属工具如果某类AI做不到这点就应该直接拒绝开发。他透露过去几周他和各大前沿实验室的负责人聊过大家在大方向上基本共识需要放缓、需要加安全措施只是具体执行细节还没谈拢。但美国政界的反应让这个进程变得复杂特朗普直接把AI安全担忧称为骗局众议院议长约翰逊认为没必要搞监管万斯更是把监管呼吁称为特洛伊木马直接拒绝了参与监管行动的邀请。现在行业还在琢磨合适的机制纯粹靠行业自律显然不够但也没有现成的监管模板可以直接套。他提到英国的AI安全研究所是合适的嵌入式评估器候选也呼吁更多人参与到微软公开征集的反馈里完善这套准则。Suleyman 一直以来的核心观点从未改变技术扩散不可避免99%的情况下都是利好我们应该让技术快速普及让所有人都能享受到AI的好处。他预测未来预训练算力会涨三个数量级也就是1000倍的FLOPS投入配合强化学习模型能力会达到让人“惊叹”的程度。现在微软已经在和梅奥诊所合作训练医疗基础模型未来能以接近超人类的准确率预测电子健康记录在用户发病前就给出干预方案这就是AI应该做的“服务人类”的事。但他也始终保持着警惕如果两年后开源的模型能在本地电脑上跑还没有任何安全限制能自主赚钱、拥有资产、主张权利那将是灾难性的。我们不需要创造一个和人类并行的新物种只需要让AI成为能帮我们解决医疗、气候、科研等问题的工具。你觉得Anthropic给AI写“福利条款”的做法是真的在考虑安全还是反而在埋隐患欢迎在评论区聊聊你的判断。