

不甘当平替,DeepSeek价格战价值战都要打。
采写/艾智
编辑/天南
8月12日深夜,DeepSeek官网API文档悄然换版——V4 Pro预览版切换为正式版。
作为性价比之王,DeepSeek这次也摸到了全球大模型的性能天花板。Terminal Bench 2.1(衡量AI智能体在真实终端环境完成任务的能力):V4 Pro 87.9分,全球第一的Anthropic Fable 5是88.0分,差距只剩0.1。
三个月前,V4 Pro预览版这个成绩还是72.1分。三个月,跃升15.8分。
更狠的是两项反超。AI安全智能体测试Cybergym上,V4 Pro 83.3分,压过Fable 5的83.1;工作流智能体测试AutomationBench上,31.8对29.1,V4 Pro直接赢。衡量软件工程能力的DeepSWE,从12.8分飙到62.7分,近五倍跃升,超过了Anthropic上一代旗舰Opus 4.8的58.0分。
这不是纸面题库的分数内卷。Terminal Bench、DeepSWE 这类评测,考察的是 AI 能不能真正 “干活”—— 自主进入终端装环境、敲命令、排查报错,读懂完整代码仓库、处理复杂工程问题、调用多步工具完成长链条任务。
这些能力,正是大模型从聊天玩具走向生产工具的核心门槛。换句话说,DeepSeek 这次补上的不是 “考试分数”,是真实场景的战斗力。
当然客观来看,在纯知识推理、超复杂全栈软件工程等场景,V4 Pro 和全球最顶尖模型仍有细微差距,多模态能力也尚未补齐。
梁文锋此前在和投资人的对谈中也承认,“我们跟美国的差距可能是落后美国 12 个月,在总体算力还是有数量级差距的情况下,全面超越是不现实的。”
但差距正在持续缩小,回看DeepSeek今年的轨迹:4月V4发布,API以2.5折优惠上线;5月优惠结束后直接永久降至原价四分之一,降幅75%;V4 Flash单周调用量突破 7 万亿 Token 登顶全球第一。长期以来,"价格屠夫"是它最鲜明的标签——性能不差,但和顶尖模型之间,还隔着一段可以感知的性能距离。这段差距,在8月12日深夜被压缩到了0.1分。
性能逼近,价格碾压。
Fable 5每百万输出Token定价50美元,GPT-5.6 Sol Max 30美元,Grok 4.6 6美元,DeepSeek V4 Pro仅0.87美元——约为Fable 5的五十七分之一。 缓存命中输入更是低到0.0036美元,比Fable 5便宜数百倍。
0.1分的跑分差距,60倍的价格鸿沟。这个等式,足以让开发者重新审视自己的技术选型——过去用 DeepSeek,是 “简单任务省成本”;现在用 DeepSeek,是 “性能摸到第一梯队,还能省一大笔钱”。
过去,DeepSeek的故事是”便宜够用"。现在,故事变成了"又强又便宜"。
就在V4 Pro上线前几个小时,马斯克的xAI发布了Grok 4.6,在GDPVal-AA v2评估中以1753 Elo登顶,超过Fable 5的1741和GPT-5.6 Sol Max的1728。两款主打高性价比的模型同夜撞车,改写全球大模型定价规则,真正感到有压力的,恐怕是OpenAI与Anthropic。
V4 Pro的强大性能,也给了DeepSeek涨价的底气。就在上线六天前的8月6日,DeepSeek刚挂出一纸涨价预告:“计划近期整体上调API服务定价,预计涨幅较大。”
刚敲定融资却选择涨价,这更像是主动的定价策略切换,而非被动的成本转嫁。摩根士丹利8月9日的研报说得很直白:模型智能,而非价格,才是大模型竞争的终极壁垒。当V4 Pro距Fable 5仅差0.1分时,DeepSeek已经有资格为这份”足够接近"收取溢价。
当然,涨价完毕之后,DeepSeek依然有数量级的成本优势。
整个行业也在同步转向。中国大模型平均API输出价格已从2025年一季度的12.2元/百万Token回升至2026年二季度的21.9元。智谱涨价83%调用量反而增长400%;月之暗面K3发布后请求量逼近集群极限暂停新用户订阅;腾讯两轮上调API价格部分涨幅达463%。
价格战的终局信号已经出现。
比涨价更值得关注的,是一个更宏观的趋势:中国大模型正在拿下全球定价权。
过去,大模型的定价权牢牢握在硅谷手里。OpenAI定一个价,全行业跟;Anthropic出一个档位,开发者照着算成本。中国厂商的定价策略本质上是”跟随者”——别人定多少,我打个折,性能比不了,就拼性价比。
现在,定价权正在易主。DeepSeek V4 Pro以0.87美元的输出定价,直接把"准Fable级Agent能力"的价格锚定在了硅谷旗舰的60分之一。这个价格锚点不是跟随出来的,是中国厂商主动定义的。当全球开发者在选型时开始以DeepSeek的价格为参照系——"这个能力值不值这个价"——定价权就已经不在硅谷手里了。
不止DeepSeek。截至 8 月 3 日 - 9 日当周,中国大模型在 OpenRouter 平台已连续 15 周调用量超过美国,稳居首位;美国企业调用中国AI模型的Token占比每周稳定在30%以上,峰值达46%;近200家硅谷初创企业联名致信美国政府,反对限制使用中国开源模型——他们不是在头脑发热,表达政治立场,是在用脚投票保护自己的成本结构。
性能逼近,价格碾压,全球开发者用脚投票——中国大模型正在完成从”跟随者”到”定价者"的角色转换。
当最擅长打价格战的玩家开始收枪,当0.1分的性能差距配上60倍的价格优势,中国大模型行业的竞争逻辑,已经翻过了一页——过去DeepSeek靠成本优势横扫市场,现在性能优势也逼近了。
对于硅谷来说,一个又强又便宜的对手,比一个只是便宜的对手可怕得多。