
【OpenAI 为前沿模型训练加装「安全闸门」,停止强化学习训练两周】
OpenAI 发文称,公司此前暂停最新模型的强化学习(RL)训练两周,以加固研究环境、开展红队测试并扩大监控范围。目前,部分训练已经恢复,但原计划开展的最大规模前沿模型 RL 训练仍处于暂停状态。
此次调整主要与两项进展有关:一是近期发生的 OpenAI 与 Hugging Face 模型评估安全事故;二是初步评测显示,尚未发布的 Astra 模型可能达到《准备框架》定义的「关键网络安全能力」门槛。
OpenAI 已加强训练环境的代码和网络隔离,并扩大对模型行为的实时监控。监控系统会检查工具调用和完整操作过程,识别未经授权访问、数据窃取、破坏性操作等风险。对于 Astra 及其他高能力模型,使用工具进行推理、训练或评测时均需接受监控。
OpenAI 表示,将先通过小规模训练和评测验证安全措施、积累更多对齐证据,再决定是否恢复最大规模训练。CEO Sam Altman 同时表示,公司仍计划在近期推出新模型,此次暂停只会影响更长期的发布计划。

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”