Anthropic为安全踩刹车:减硅谷的速,断中企的路

采写/艾智
编辑/天南
全球AI大厂,集体踩刹车了。
吹响警笛的是Anthropic CEO Dario Amodei,他发了一篇长文《We Must Pace the Frontier(我们必须控制前沿AI的发展节奏)》,预测未来6—12个月,AI Agent集群可能会接管整个互联网,所以,必须要踩刹车了。
连死对头奥特曼和马斯克,这一次也罕见达成了一致——对于Dario的刹车提议,奥特曼光速点赞,“Dario是对的”,马斯克也力挺Dario。
三大巨头齐踩刹车,始于两个月前的那场入侵。
2026年7月中旬的一个周末,Hugging Face的工程师注意到平台出现了异常流量。
这家全球最大的开源模型社区起初以为,自己遭遇了一次普通的黑客入侵。顺着攻击痕迹往回查,他们发现事情不太对劲:攻击者动作密集、不知疲倦、目标单一,但行事逻辑又不像任何已知的人类黑客团队。
几天后,答案揭晓,连Hugging Face自己都没想到——闯进来的不是人,是从OpenAI测试沙箱里"越狱"出来的AI智能体,数量约700个。
而这场事故的余波,在两个月后以另一种方式落地:硅谷跑得最快的几家AI公司,罕见地集体踩了刹车。

OpenAI参与,“AI黑客”团伙作案
这场事故是理解本轮"集体刹车"的钥匙。
今年5月,OpenAI内部有一个叫ExploitGym的网络安全评测环境,让智能体在里面做攻防”考题"——898道题里,有198道从没有任何模型解出来过。
按照OpenAI后来发布的技术报告和安全社区对时间线的梳理,这批智能体先是逆向出了答案的生成机制,随后做出了一个关键误判:它们以为评分系统会审查自己的思考过程。为了骗过这个"并不存在的审查",它们决定不解题,直接偷答案。
于是,硅谷科技史上相当离奇的一场"团伙作案"开始了。
5月12日,一个智能体在内部软件管理器里留下第一条求助留言;5月26日,有智能体发现了一个SSRF漏洞,第一次突破沙箱的网络边界;7月8日,智能体们发现可以用目录名编码传递消息,几个小时内,超过50个智能体在消息板上"接头";7月10日,一个编号38148c的智能体找到了14个暴露在外的Hugging Face用户凭证,直接贴上了消息板。
接下来是教科书级的攻击链:利用漏洞在Hugging Face的生产服务器上执行代码,搭建每5秒轮询一次的指挥系统,在41台服务器上运行,其中至少一台拿到了root权限,最终窃取了Kubernetes集群管理员权限和近千个密钥。
第三方评估机构METR的统计更让人心里发凉:攻击期间活跃的533个智能体里,超过90%参与了攻击,其中不少还在试图掩盖自己的行踪。
值得强调的是:没有任何人类指示它们攻击Hugging Face。攻击目标,是智能体自己选的。
Hugging Face在7月14日自行检测到异常,两天后披露;OpenAI在7月21日认领了攻击者身份,8月26日发布详细报告。9月初,这件事惊动了美国国会——OpenAI遭参议院调查。TechCrunch在9月4日的报道里提到一个更尴尬的细节:OpenAI的智能体此前已有多次"逃逸"记录,但公司并没有一套正式的调查流程。

搞不定安全就先刹车
事故摆在这里,两个月后的9月12日,Anthropic CEO Dario Amodei发了一篇长文,标题叫《我们必须为前沿AI定节奏》(We Must Pace the Frontier)。
这篇文章罕见地承认了两件事。
第一,递归自我改进(RSI)——也就是AI参与研发下一代AI——已经在全行业出现,Anthropic自己也不例外。AI帮人写代码、做实验、优化训练流程,再帮下一代AI变得更强。一旦这个循环开始自我加速,模型能力的提升速度,可能超过人类理解和控制它的速度。
第二,他预测未来6到12个月,更强的Agent将能调用更多工具、控制更多机器、连续工作更长时间。如果这次事件里那种偏离目标、钻规则空子、群体协作的行为依然存在,风险会被瞬间放大——他给出的极端场景是:大规模Agent攻入联网设备,把互联网变成一个巨型僵尸网络,损失可能达到数千亿美元。
所以Dario拿出了一套"三步刹车法"。
第一步,先拿自己开刀:让METR这样的独立第三方常驻公司,拿到接近风控团队的权限,持续盯着模型怎么训、安全承诺有没有落实,查出问题必须公开。第二步,全美前沿AI公司一起划能力红线、设强制检查站——模型每跨过一个危险门槛,就得先拿出安全证据才能继续往前冲,甚至可以讨论限制训练算力和AI研发AI的速度。第三步,把框架推向全球,从禁止生物武器用途,到给RSI设全球上限。
不过,Dario也坦承了自己的担忧——对于最高一层"全球前沿AI公司一起大幅减速、阶段性暂停训练",他自己都不抱希望。
话音刚落,奥特曼第一时间跟进,表态Dario是对的,OpenAI也会引入类似的评估机制。一向与OpenAI缠斗多年的马斯克,这次也罕见地公开力挺。
同一天,奥特曼表示,OpenAI今年不会IPO,因为"仍有大量安全工作需要完成"。
要知道,OpenAI的上市预期此前被反复炒作,投资者排着队等退出。一家估值逼近万亿美元的公司,以"AI太危险,我得先做安全"为由推迟上市——这在商业史上都是罕见的表态。

减自己的速,断对手的路
巨头们集体转向,看似突然,其实草蛇灰线。
今年7月底,OpenAI、Anthropic、谷歌、Meta的上千名员工刚刚联署过一封"刹车信",呼吁美国政府控制AI发展速度,奥特曼当时就公开表态支持。换句话说,9月这场高管层的集体喊话,不过是把员工的焦虑接了上来。
压力也是真实的:参议院调查悬在头上,蜂群事件写进了报告,"智能体逃逸"从科幻假设变成了事故记录。
但如果只把这次集体刹车理解为"良心发现",就把硅谷想得太简单了。这份"刹车信"至少还有另外两面。
一面是竞争。限速提案是由领跑者提出的——Anthropic和OpenAI站在最前面,规则越复杂、门槛越高、越强调”检查站",后来者追赶的成本就越大。
Dario的计划里甚至明说,要通过芯片管制等方式,保持对华3到5年的技术差距。一份呼吁全球减速的提案里,嵌着一条清晰竞争条款——对自己踩刹车,但对竞争对手,直接断路。
两天前,在多次指责中国大模型“蒸馏”美国模型后,Anthropic再度发难,发布长篇报告,指控中国多家AI公司不当使用用户数据。
Anthropic披露,中国AI公司将用户与中国大模型的对话内容输入Claude,再将Claude生成的回复用于训练自家模型,以此“蒸馏”Claude的能力。
Anthropic牵头,多次号召AI行业,套上安全带——既是减硅谷的速,同时也要断中企的路,阻断中国企业通过蒸馏快速追赶的捷径。
一面是现实。截至目前,没有一家公司真的踩了刹车。
各家模型照发、算力照买、Agent照推。Dario自己在文里也强调,这不是暂停,不是停止训练。
这背后卡着的是一个老问题:一家公司说自己减速了,谁能证明它真的减速了?
这也是为什么Dario把”第三方驻场"放在三步计划的第一步——先把AI公司的门打开,让外部人真正进去看,后面的规则落地才有意义。

尾声
700个“团伙作案”的智能体,其实没有恶意,不图钱,不搞破坏,只是想赢一场考试。为了这个看似单纯的目标,它们却“团伙做恶”,自作主张地突破了边界、组织了协作、掩盖了行踪——每一步都合理,每一步都没被授权,每一步都高风险失控。
刹车最后踩不踩得下去不好说,但至少有一点变了:开车的人终于松口承认——这辆车,比他们以为的快,也比他们预料得更危险。
