GPT-6 Astra贵了2.5倍,但我却没看到期待中的提升

GPT-6 Astra贵了2.5倍,但我却没看到期待中的提升

国产模型卷了大半年,这一周终于轮到海外几家挤在一起发新模型。

前脚 Claude Fable 5.1、Gemini 3.8 Flash、Muse Spark 1.3 刚发完,今天最后轮到 OpenAI,GPT-6 Astra 来了。

这一轮看下来,Astra 在电脑操作和任务自动化上重新超过了 Anthropic,数学和网络安全也往前走了一截。

编程只领先一点,第三方综合榜甚至还排在 Claude Fable 5.1 后面。价格倒是先涨上去了,是 GPT-5.6 Sol 的2.5 倍

01

电脑任务耗时少了近一半

OSWorld 测的是模型能不能像人一样看屏幕、点按钮、切软件,把一件事从头做到尾。Astra 的成绩比 GPT-5.6 Sol 高 10.5%。

我更在意速度。Sol 平均要做 75 分钟的任务,Astra 缩到 40 分钟,少了47%

以前模型能跑完不少电脑任务,可速度慢到你宁可自己动手。40 分钟依然不短,但已经能放到后台跑了。

官方给的 3D 案例很直观。Astra 先在 Blender 里做好房屋模型,再转进 Unreal Engine 5,变成一个可以走进去查看的场景。

建模、导出、导入游戏引擎,这段跨软件流程开始可以交给模型处理。

自动播放

▲ 图:Astra 生成的可探索房屋场景。演示视频有剪辑,只能看出产品打算怎么用,不能拿来判断成功率。来源:OpenAI 官方案例、案例视频。

Astra 也补了长任务记忆。这个功能目前在 Codex 里需要手动开启,接下来几周才会成为 Astra 的默认设置。

上下文用完后,它会保存工作笔记,还能搜索前面的消息和工具结果。任务跑久了,模型忘掉早期要求、重复踩坑的情况会少一些。

02

自动化拉开了,编程没有

AutomationBench 测多步骤办公任务,比如整理资料、操作表格,再把结果填进另一个系统。

Astra 的成绩是 Sol 的2.3 倍,比 Claude Fable 5.1 高 32%。这是这次发布里拉得最开的一项。

到了编程,差距就小多了。

Terminal-Bench 4.0 用真实的命令行任务考模型,Astra 比 Sol 高 55%,但只比 Claude Fable 5.1 高 3.4%。

OpenAI 在这一项超过了 Claude,谈不上拉开距离。

早期测试者Peter Steinberger提到一个例子。Astra 调试 Objective-C 项目时,一路追到上游依赖,找出问题后直接打了补丁。

它没有停在用户给的代码里,继续顺着依赖找原因。

数学也赢了。FrontierMath Tier 4 的题接近研究难度,Astra 比 Sol 高 18%,比 Claude Fable 5.1 高 11%。

分数已经靠近满分,后面再争几个小数点,参考价值不会太大。

▲ 图:五项核心测试的当前数据。Astra 在四项领先,综合指数仍由 Fable 5.1 领先。来源:OpenAI 官方发布;AI范儿整理。

▲ 图:五项核心测试的当前数据。Astra 在四项领先,综合指数仍由 Fable 5.1 领先。来源:OpenAI 官方发布;AI范儿整理。

03

网络安全这块,有点麻烦

ExploitBench 测模型能不能把已知漏洞写成可以运行的攻击代码。Astra 做完了全部测试,比 Sol 高 27%。

OpenAI 还拿最近三个月公开的新漏洞测了一轮,尽量避开模型背过旧题的情况。Astra 的成功率是 Sol 的7.1 倍,测试期间还找出两个没有公开过的零日漏洞。

OpenAI 用 Preparedness Framework 给前沿模型划风险级别。Astra 是 OpenAI 第一个达到网络安全 Critical 门槛的模型。

配合相应的工具和权限,它可以自己寻找未知漏洞,并为防护较强的系统设计新的利用方式,不需要人一步步带着做。

因此,公开版本会拒绝高级漏洞利用任务。OpenAI 计划通过 Daybreak,在接下来的几周逐步向防御团队开放更多能力。

攻击能力之外,System Card还写了监控问题。可监控性说的是,人能不能从模型留下的推理过程里看出它在越权。

在明确要求 Astra 躲开监控的压力测试里,它有时会故意答差而不被发现,部分破坏任务也更难被监控识别。

但在需要复杂推理的任务里,报告没有观察到成功的全程规避。

不过,在 54,218 个内部 Codex 任务模拟里,Astra 收到的高严重度行为标记只有 Sol 的一半左右。

把两组结果放在一起看,会有点别扭。平时越权少了,真让它藏,监控又更难抓到。

▲ 图:Astra 的网络安全能力、风险等级和监控结果。来源:OpenAI 官方发布与System Card;AI范儿整理。

▲ 图:Astra 的网络安全能力、风险等级和监控结果。来源:OpenAI 官方发布与System Card;AI范儿整理。

04

第三方总榜没那么夸张

Artificial Analysis Intelligence Index 把知识、数学、编程、长文本等测试合成一个总分,可以粗略看一个模型的综合水平。

Astra 在这张榜上跟 Sol 基本持平,比 Claude Fable 5.1 低约 8%。它当然在第一梯队,但不是总榜第一。

专门看编程智能体的 Coding Agent Index,Astra 比 Sol 高约 3%,跟 Claude Fable 5 持平,比榜首 Fable 5.1 低约 4%。

所以如果说“OpenAI 全面压倒 Anthropic”这句话就过头了。电脑操作和自动化赢得比较清楚,综合能力与编程总榜还没有。

▲ 图:综合智能指数和编程智能体指数。来源:Artificial Analysis。

▲ 图:综合智能指数和编程智能体指数。来源:Artificial Analysis。

05

token 省了,账单未必

Token 可以先理解成模型读写内容时使用的计费单位。完成同一个任务,用得越少,一般越快,也越省钱。

在编程智能体测试里,Astra 使用最高推理强度时,token 用量比 Sol 少69%。这个进步不小。

问题是单价涨了 2.5 倍。Astra 每百万输入 token 收 10 美元,输出 token 收 50 美元。

第三方跑完整套综合测试后,单项成本还是比 Sol 高 75%。token 确实省了,涨价把节省的大部分又吃了回去。

▲ 图:Astra 在不同推理强度下的 token 用量。来源:Artificial Analysis。

▲ 图:Astra 在不同推理强度下的 token 用量。来源:Artificial Analysis。

06

它现在排在哪儿

单看电脑操作和任务自动化,Astra 已经站到最前面。数学和网络安全也是目前最高的一档。

编程跟 Claude 的旗舰模型咬得很紧,但没有甩开;第三方综合能力总榜仍由 Fable 5.1 领先。

Astra 目前先向少数机构开放,Plus、Pro、Business 和 Enterprise 用户将在接下来的几天分批拿到。API 型号是gpt-6-astra。

这次涨价换来的主要是任务执行速度、跨软件操作和长任务能力。聊天与综合推理的总榜成绩,没有跟着拉开同样大的差距。

Greg Brockman 把这次发布叫作“AGI 时代”,但这个词最近真的用烂了🌚。

OpenAI 自己的 System Card 里,Astra 的 AI 自我改进能力还没达到 High 门槛。这里说的自我改进,是让模型调试 AI 研究实验、优化训练过程和计算内核。

至少按 OpenAI 这套标准,Astra 还不能用来证明 AGI 已经到了。

训练规模倒是很大。Astra 的训练动用了超过10 万张 GPU,是 OpenAI 目前规模最大的一次。上一代模型也参与了训练监督。

我自己的感受有点复杂。模型现在几乎每天都在更新,benchmark 也越堆越多,但实际怎么样,还得自己去用了才算数。

GPT-6 原本是我这段时间最期待的一次发布,因为最近一直在用 Codex,但从目前的第三方排名看,Astra 跟 Sol 的差距没有想象中那么大,也没有把 Claude 甩开。

到底是榜单没测出电脑操作和长任务的变化,还是提升确实有限,等我拿到它实测一轮再说。