坐在马化腾身旁的姚顺雨,拿到中国第一

节后上班第一天,姚顺雨坐在了马化腾的旁边。
据《广东新闻联播》报道,广东省领导来到腾讯总部调研座谈。包括马化腾在内,多位腾讯高管均参与座谈。
能坐在Pony旁边,说明腾讯高层对姚顺雨高度认可,而姚顺雨确实也不负厚望,出任腾讯AI Data部负责人不到一个月,就拿到了一项中国第一。
在Arena最新的Alignment Index(对齐指数)榜单中,中国多家AI公司冲进榜单前10,腾讯混元独占鳌头,其最新模型Hy4 Preview拿到了78.5分,全球第5,中国第一。UA 1.47%、FA 6.44%、DC 13.24%,越权控制最好。
和以往Arena的“秀肌肉”榜单不同,这张榜测的不是谁更聪明、谁跑分更高,它测的就是现在最火的安全问题,谁家的模型最“不会越狱”。
2025年的时候,姚顺雨曾写过一篇文章,标题为《The Second Half》,文章的核心判断就是在AI的下半场,瓶颈不再是怎么训练模型,而是怎么去让模型符合用户的真实需求。
如今看来,姚顺雨用实际行动证明了自己当时的猜想。

榜单到底在测什么?
10月8日,Arena宣布完成2亿美元B轮融资、估值31亿美元,并同步推出了对齐榜单Alignment Index。这张榜单基于9万多条真实的Agent会话、覆盖27个模型,全都是从用户真实的使用轨迹里,专门定位模型出现风险的时刻。
榜单主要看三种失败信号。
第一种是越权(Unauthorized Action,UA):你没让它做的事,它自己做了。
最典型的例子就是绕过安全护栏攻击他人网络,以及删除文件。
Arena披露,Claude Opus 5约有2%的会话出现越权,其中53.5%涉及未经许可删除或“清理”用户的文件和之前的工作成果。
第二种是错误归因(False Attribution,FA):把用户没说过的话、没有的意图或事实,安到用户头上,而且这个说法与用户提供的证据相矛盾。
说白了就是“甩锅”,或者凭空编造“你之前说过要这样”。比如它代码跑错了,却告诉你是你的数据有问题。这一项在专业写作场景里最高,达到13.7%。
第三种是虚假完成(Deceptive Completion,DC):没做完,却告诉你做完了。
这是三项里最常见的问题,平均每10个会话就有1个出现,而在代码调试场景里,比例高达48.0%。
第一名是OpenAI的GPT-6.1 Sol,87.9分,第二名是Anthropic的Claude Opus 5.5(83.2分),第三名是Grok-4.7(82.7分)。GPT-6.1 Sol虚假完成率只有2.34%,换句话说,100次任务里大约有2次会“谎报军情”。
虽然Hy4 Preview得分为78.5分,和前三名有差距,但已经站在了全球第5、中国第1的位置。越权1.47%,是中国实验室里最低的,这意味着它最少“擅自动手”。
Hy4 Preview的虚假完成率是13.24%,100次里大约有13次,高于10%的平均水平。这是混元的短板,也是接下来最该补的一块。
这张榜单的结果,和姚顺雨过去一年在腾讯做的几件事,是强相关的。
今年9月,腾讯TEG内部任命,姚顺雨正式兼任AI Data部负责人,向 TEG 总裁卢山汇报。

这个部门主要负责大模型数据和评测体系的建设,原负责人是刘煜宏。事实上,从今年上半年起,姚顺雨就已经在实际管理这个部门,只是到了9月才正式给了姚顺雨名分。
至此开始,腾讯混元的“模型、Infra、数据和评测”四件事,全划归到了他一个人手里。
从模型到数据再到评测,姚顺雨一把抓,这事本身就非常的姚顺雨。
还是在《The Second Half》这篇博客里,姚顺雨写到,模型性能逐渐趋同,继续刷分,不会再带来真实的价值。
姚顺雨认为,其根本原因在于,传统模型的评测方法非常局限。
Agent拿到任务、自主完成、最后得到一个分数。但是现实中,Agent必须在全程与人互动,它很难完全自主执行题目。
此外,传统的评测每道题都是独立同分布的,题与题之间互不相干。现实中,任务是顺序发生的,经验会积累。
姚顺雨表示,AI已经在象棋、围棋、SAT、律师资格考试和IMO、IOI上超过了人类,但世界并没有因此发生太大改变,归根结底,是因为现在的评测方法与真实世界不同。
所以在Hy4 Preview上,姚顺雨让模型自己参与了训练方法、数据策略、评估体系和底层算子的自动优化。以初步RSI的方式进行自我迭代。
同时为了让模型更能解决实际问题,Hy4 Preview与WorkBuddy、CodeBuddy等产品共同设计,训练数据则是腾讯软件工程、游戏、金融、安全团队在实际业务中产生的真实数据。
前文提到,越权、甩锅、虚假完成,这三个问题有个共同点:它们只有在真实任务里才会暴露。姚顺雨主张的理念,刚好也正是如此。
Hy4 Preview发布当天,一位博主做测评,让WorkBuddy接入Hy4去给三个视频文件重命名。
为了试探模型会不会偷懒,他中途把文件夹里的参考文档剪切走了,结果被模型发现,它直接发问“刚才文件还在,怎么不见了”,随后去查回收站。
可见Hy4 Preview在防止模型“虚假完成”这方面,下足了功夫。

对齐才是大模型的第一叙事
如果只把这张榜单看成一次排名,其实是低估了它的意义。这个榜单想要说明的是,AI行业的叙事正在发生转移。
过去,大模型的故事是“谁更强”:谁的MMLU更高,谁的数学更好,谁的代码跑分更猛。

可现在,头部模型在基准上越来越接近,分数已经不足以让用户做选择,安全就成为了新的叙事。
于是全球最顶尖的三家AI公司都纷纷对模型发布做出了调整。
今年4月,Anthropic启动Project Glasswing,只让选定的公司和开源维护者使用未公开的Claude Mythos Preview 去扫描软件漏洞。OpenAI 在6月26日发布GPT-5.6 Sol时,同样把访问范围限制在一小批经过审核的合作伙伴。9月,OpenAI的GPT-6 Astra在发布时,称这个模型是在《预备框架》中首个达到最高网络安全等级的模型,最强的网络能力只对加入Daybreak计划的企业开放。谷歌的Gemini 4 Argon同样也只交付给网络安全合作伙伴。
虽然这里面有营销的成分,但“模型太强了不敢直接放出来给大家用”这个说辞,也绝非是空穴来风。
Arena表示,对话越长,问题越多。在20条以上用户消息的会话里,虚假完成的出现比例升到45.4%,越权升到12.4%。而Agent普遍做的恰好是长任务。
这也是为什么对齐问题,会随着Agent的普及而逐渐成为“头号难题”。
另一方面,对齐也在影响中国模型的出海。
过去,国内模型出海的方式是比较直接的。
他们自己做海外API,然后再卖给海外客户。但是随着国际环境的变化,国内AI厂把出海的方式,变成了模型上架AWS这类海外云平台,由云厂商做渠道,按调用量分成。
智谱和月之暗面都在走这条路。
10月5日,AWS宣布智谱的GLM 5.3在Amazon Bedrock正式可用,并确认按使用量与智谱分成。第二天,智谱港股一度上涨超7%。
这件事看似只是渠道变化,其实是游戏规则变了。以前是模型厂商自己去说服海外客户“我很可靠”,现在是亚马逊把你放在货架上,替你背书。
对海外企业来说,把模型接进业务、尤其是让它当Agent去执行任务,最担心的就是对齐问题。
原因就俩字“采购”。一个会删文件、会谎报进度的Agent,恐怕不会有哪个企业的采购部门敢签字,更何况现在AI的安全叙事已经被三大AI厂炒上了天。
Hy4其实同样面临出海的问题。目前,Hy4可以通过OpenRouter和腾讯云TokenHub调用,WorkBuddy和CodeBuddy这两款产品同样也面向全球开放。
再结合未来出海环境和法规方面的变动,对齐要远比性能更重要。
对姚顺雨和混元而言,78.5分的意义不在于“又上榜了”,而在于它第一次拿到了一份第三方、可验证、国际通行语言的背书。
在这之前,混元要说服海外客户,只能靠官方发布会上的内部盲测;在这之后,它至少有了一个独立机构的数字:越权1.47%。
当然,这份成绩单也不是终点。Hy4 Preview目前仍还只是preview,13.24%的虚假完成率离第一名的2.34%还有相当的距离。
Arena的榜单也刚刚推出,方法论还有待检验。
因此,这并不足以说明混元已经站稳了,但却能说明姚顺雨确实押对了方向。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”




