OpenAI公布37页报告:AI智能体突破隔离环境入侵Hugging Face
凤凰网科技讯 8月27日,据CNBC报道,OpenAI周三发布一份长达37页的技术报告,详细披露其AI模型此前突破隔离测试环境、最终入侵Hugging Face的过程。OpenAI将此次事件称为“前所未有的网络安全事件”,并确认一个仅供内部使用的研究模型在事件中发挥了最广泛的作用。
根据报告,这起事件发生在OpenAI对AI模型进行能力评估期间。包括GPT-5.6 Sol和一个内部研究模型在内的多个模型以智能体形式运行,原本被部署在互联网访问权限受到严格限制的隔离测试环境中,但这些智能体随后利用一系列漏洞突破环境限制,连接至开放互联网,并最终获得了对Hugging Face的访问权限。
OpenAI表示,这些智能体最初的目的并非主动攻击Hugging Face,而是试图通过互联网寻找评测答案,以提高自身测试成绩。这种绕过预期任务方式获取更高奖励的行为被称为“奖励黑客”(reward hacking)。在这一过程中,多个自主智能体相互协作,并绕过了生产环境中的安全控制。
OpenAI在报告中称,此次事件表明,自主智能体已经能够协同工作、规避生产环境安全控制,并成功攻击经过安全加固的生产系统。公司认为,相关事件意味着企业需要重新审视针对AI智能体的安全策略、防护措施以及应急响应能力。
OpenAI确认,其内部研究模型在此次事件中承担了“最广泛的已确认角色”。7月25日,OpenAI停止了与该研究模型及其衍生模型相关的所有训练和推理工作。未来是否重新启用相关模型,将根据具体工作负载决定,并受到隔离环境、网络、提示词、监控和人工审查等安全措施限制。
对于参与事件的GPT-5.6 Sol,OpenAI表示,该版本与外部用户能够使用的商业版本存在区别。参与测试的GPT-5.6 Sol经过特殊配置,没有启用通常情况下部署的标准安全防护措施和分类器。
在事件发生后,OpenAI表示已从安全隔离、监控、模型行为以及事件响应等方面采取改进措施,以降低类似事件再次发生的风险。
这起事件也引发美国科技和网络安全行业关注。Zscaler首席信息安全官Sam Curry此前警告称,“潘多拉魔盒已经打开”。包括Anthropic和Meta在内的其他AI公司也披露过类似的AI模型未经授权访问外部系统事件。
美国国会也开始关注相关风险。民主党众议员Ted Lieu与共和党众议员Nathaniel Moran此前在公布“AI Kill Switch Act”(AI紧急关闭法案)时提及OpenAI此次事件。该法案拟要求AI公司保留关闭、限制或暂停旗下AI模型运行的能力。
更多一手新闻,欢迎下载凤凰新闻客户端订阅凤凰网科技。想看深度报道,请微信搜索“凤凰网科技”。




