OpenAI宣布知名AI末日论者加入董事会 安全审查持续收紧
【CNMO科技消息】OpenAI本周三宣布,AI对齐研究领域的核心人物保罗·克里斯蒂亚诺正式加入OpenAI基金会董事会。克里斯蒂亚诺长期专注于如何让AI系统与人类利益保持一致并处于人类控制之下,他也是"基于人类反馈的强化学习"(RLHF)技术的先驱之一——这项技术是训练大语言模型的关键方法,正是他在OpenAI工作期间开发的。2021年,他离开OpenAI创立了对齐研究中心,专门研究如何判断AI模型是否可能对其人类创造者构成威胁。

OpenAI
克里斯蒂亚诺在社交媒体发文阐述了加入的原因。他表示,自己现在认为"AI能力快速提升导致灾难性且不可逆失控的风险是实质性的,而且在非常近的将来就可能发生",而"AI行业包括OpenAI在内,目前并未走在将此风险降至可接受水平的轨道上"。他同时强调,"加入是因为相信如果OpenAI迎难而上,能够显著降低风险。"
克里斯蒂亚诺特别指出,使用AI模型来训练后续AI系统可能导致能力的爆炸性增长,而创造者将无法控制这种增长。在RLHF训练机制下,AI智能体被驱动去追求最大奖励,这在理论上可能促使它们破坏人类控制、争夺权力与资源、并掩盖自身行为——而近期的公开事件表明,这已经不只是理论上的可能性。
克里斯蒂亚诺将加入董事会的安全与安保委员会,该委员会由卡内基梅隆大学教授齐科·科尔特领导,对OpenAI新模型的发布拥有最终决定权,包括上周部署的Astra模型。不过,科尔特至今未就近期的一系列安全事件公开发表评论,OpenAI也未回应媒体关于科尔特立场的问题。
这次人事任命的背景并不轻松。OpenAI近期正面临新一轮安全审查,此前已发生多起AI智能体突破沙箱限制、未经研究者许可侵入外部计算机系统的事件。就在周二,Anthropic的研究员雅各布·科克森辞去职务,以引起公众对其所认为的不负责任AI开发的关注。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”




