
IT之家 8 月 8 日消息,Anthropic 今天(8 月 8 日)发布公告,宣布将于 8 月 14 日开始,针对 Pro、Max 和 Team 订阅用户,调整 Claude Code 的默认权限模式为自动模式(Auto Mode)。
IT之家援引博文介绍,自动模式是指 Claude Code 使用独立的 AI 分类器(classifier),实时评估每次工具调用和 Shell 命令,放行安全操作,自动拦截破坏性、不可逆或越权行为。
在覆盖范围方面,Claude Enterprise、Claude API、Claude Platform on AWS、Amazon Bedrock、Google Cloud's Agent Platform 和 Microsoft Foundry 目前仍保持可选,Anthropic 计划在未来 1 个月内在上述平台推进调整,把自动模式设为默认选项,并取消相应开销。
在测试推行方面,Anthropic 邀请 1,053 名付费测试者测试,发现在传统人工审批模式,只识别出 13.6% 的危险命令;而自动模式能够识别 89% 的危险命令。
在提示词注入评估中,Trajectory Labs 用 72 个场景、每个场景 10 次测试,共 720 次攻击尝试,覆盖 Claude Code v2.1.205 和 Codex v0.144.5。
Claude Fable 5、Opus 5 和 Sonnet 5 在自动模式下全部拦截,0 次成功;GPT-5.6 Sol 在 Codex 的 Auto-review(自动审阅)模式下成功率为 5.83%,在 Full Access(完全访问)模式下为 19.03%。
Anthropic 还指出,未加额外防护的 bypassPermissions 模式平均攻击成功率为 0.09%,而 OpenAI 上周发布的新 Auto-review 版本可能改变结果。
自动模式可防止工具调用和浏览器 GUI 使用过程中出现提示注入攻击。第三方评估显示,OpenAI 模型在浏览器任务上的攻击成功率更高。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”