实测完DeepSeek V4 Pro正式版,我发现下一条斩杀线可能藏在它的Agent里
科技
科技 > 人工智能 > 正文

实测完DeepSeek V4 Pro正式版,我发现下一条斩杀线可能藏在它的Agent里

一夜之间,三款重磅模型罕见撞车。

Grok 4.6 纸面跑分逼近 Fable 5,大有成为海外御三家的势头。

总参数达到 2.4T 的 Qwen3.8 Max 也如期开放权重;DeepSeek 这边,DeepSeek V4 Pro 正式版(deepseek-v4-pro)同步上线,并开放 API 接口。

看完 V4 Pro 正式版的跑分图,我只能说,这波提升还是肉眼可见的。

Image

但这年头,跑分没输过,实际体验没赢过的模型我们也见得太多了。因此,我们也第一时间将 deepseek-v4-pro 接进 Codex 和 Claude Code,看看实际效果如何。

V4 Pro 正式版到底好不好用?

先从文字能力开始。

我让 V4 Pro 正式版模仿鲁迅,写一篇约 400 字的短文,吐槽现代人饿着肚子也要先给饭菜拍照发朋友圈,同时要求兼顾年代感、讽刺和幽默。

结果如下:

说实话,第一眼看过去,离真正的鲁迅先生肯定还有距离。

开头甚至直接借用了鲁迅最具辨识度的经典句式,模仿痕迹相当明显。但 V4 Pro 正式版至少没有把鲁迅风机械理解成半文半白、生僻词和之乎者也。

它能抓住句式节奏,也知道把“吃饭拍照”从一个日常行为慢慢引向展示欲、面子和旁观者评价。

更重要的是,整篇文章的AI 命题作文味已经比较淡。虽然还算不上一代文豪,但至少没有那种让人两眼一黑的模板拼接感。

如果说模仿鲁迅多少还有点考试意味,接下来这封商务邮件,就更接近日常工作了。

我假设公司内部失误,导致一个大客户的定制系统延期一周,让它写一封道歉邮件,要求承认责任、提出补偿,同时不能把客户合作信心写没了。

V4 Pro 正式版没有用多方面因素、项目节奏调整这类常见的职场模糊表达,而是直接承认此次延期完全源于我方内部的失误,随后给出了延长质保、增加免费培训和专属运维三项补偿。

整封邮件 28 秒左右完成,正文基本到了修改一下信息就能使用的程度。

有意思的是,邮件写完以后,它又额外解释了一遍为什么这么写,颇有一种交完卷还要给老师讲解答题思路的执着。

文笔测完以后,我把 DeepSeek V4 Pro 正式版接进了 Codex。

DeepSeek 已经原生支持 OpenAI Responses API,官方也直接提供了 Codex 接入方案。配置完成后,Codex CLI、ChatGPT 桌面端和 VS Code 的 Codex 插件可以共用同一份配置。

我也测试了几个编程任务。

我先丢给它一个很典型的大而全前端需求。

经典的 macOS 风格 Web OS,要求所有代码放进单个 HTML 文件,同时加入文本编辑器、Terminal、代码编辑器、游戏、文件管理、画图和视频编辑等应用。

单看完成度,这应该是我此前测试过的同类模型里,功能最丰富的一版。多个应用都做出了基本界面和交互,系统框架也搭得比较完整,只不过审美嘛,就比较中规中矩了。

随后我又测试了一个拍立得相机案例,需要完整模拟按快门、闪光、出纸和 8 到 10 秒化学显影的过程,同时叠加复古偏色、轻微杂色以及类似宝丽来照片的表面质感。

从成品来看,动画之间的衔接也是比较自然流畅的。

再比如直接上 Three.js 和 WebGL,让它生成可以交互的黑洞吸积盘,鼠标改变观察角度以后,星空、吸积盘和光线弯曲都要跟着变化。

面对 WebGL 这类对性能敏感的场景,V4 Pro 对粒子数量、实时计算、渲染开销和动画复杂度的控制仍然偏激进。光打开网页,我的 M2 电脑已经开始明显掉帧。

最后则是一套科幻飞船驾驶舱 HUD,需要同时处理动态准星、雷达、航向、速度、能量、目标锁定和鼠标移动后的惯性偏移。V4 Pro 正式版最终把主要交互关系都做了出来。

总的来说,如果不存在官方部署 bug 的前提下,V4 Pro 正式版应对复杂任务的完整度还是有所提高,只不过,整体体验下来,我也总感觉少了一些特别惊艳感,甚至有些地方没有比 V4 Flash 拉开想象中那么大的差距。

不过放到 Agent 场景里,如果 Flash 已经能完成 80% 甚至 90% 的任务,Pro 只负责少数高难度节点,那么真正高效的系统,会动态决定什么时候调用 Flash,什么时候调用 Pro,而不会全程挂着最贵的模型。

换句话说,模型之间的能力梯度,本身可以变成 Agent 的成本优化空间。

DeepSeek 的下一张牌,藏在 Harness 里

规格上,DeepSeek V4 系列已经把上下文拉到 1M tokens,最大输出达到 384K tokens。

普通聊天基本用不到这么大的窗口,但 Coding Agent 很容易需要同时处理几十个文件、历史修改、工具返回结果和长时间任务状态。上下文越长,模型能够留在手里的项目资料越多。

代价也是不言而喻的,Token 会迅速上涨。

这也解释了 DeepSeek 宣布近期会上调 API 价格以后,为什么外界如此关注。

当前 V4 Pro 正式版缓存命中的输入价格为每百万 tokens 0.025 元,缓存未命中输入 3 元,输出 6 元。V4 Flash 则分别是 0.02 元、1 元和 2 元。

Pro 的输入和输出价格基本是 Flash 的三倍,但放到全球市场里,依然十分便宜。

DeepSeek 自己也已经提前提醒,API 服务近期计划整体涨价,而且涨幅预计不会小。所以现在的 3 元输入、6 元输出,更像一个阶段性价格。

另一个值得注意的地方是,按照现有模型信息,它的主要能力仍集中在文本、推理、Coding、Tool Calls 等方向,暂时还没有看到图像、视频等原生输入能力。简言之,多模态目前并不是 V4 Pro 正式版的重点。

相比之下,V4 Pro 正式版发布前后,DeepSeek 在 Agent 方向上的动作明显密集了起来。

在过去的两三个月里,我们也看到正式挂帅 DeepSeek Harness 部门的崔添翼,在各个平台疯狂摇人,主打一个求贤若渴。

包括一个名为 DeepSeek Harness 团队 的官方微信公众号近期也完成注册,认证主体属于深度求索,目前还没有发布内容。

Harness 是今天 Agent 竞争里经常被模型光环遮住的一层。

模型负责推理,真正决定 Agent 如何读文件、调工具、管理上下文、失败重试和持续执行的,还有外面的整个运行框架。

Claude Code 和 Codex 的实际体验,也从来不只由底层模型决定。

尤其当 DeepSeek 手里同时有 Flash 和 Pro 之后,Harness 又多了一项很现实的工作:决定什么任务值得上 Pro,什么任务交给 Flash 就够了。模型路由一旦做好,Agent 不需要为了少数高难度步骤,全程承担 Pro 的价格。

r/LocalLLM - DeepSeek V4 Flash just drew a pretty brutal

在模型的成本优势上,我们已经见识到了 DeepSeek 的斩杀线打法,它不必在每一项能力上都拿第一,只要模型达到绝大多数任务能做完的水平,再把调用价格压得足够低,就足以占据一席之地。

同理,现在 DeepSeek Harness 团队最值得关注的地方,是如何将 DeepSeek 已经建立起来的模型成本优势,继续传导到整个 Agent 系统。

让模型更少重复读取上下文,让工具调用更高效,让长任务尽量避免无意义消耗,让同样一个任务需要的 Token 更少,再把底层模型本身的价格优势叠加上去。

到那时,哪怕 DeepSeek 未必要亲手做出下一个称霸市场的 Claude Code,只要越来越多的 Claude Code 建立这套极致性价比的体系之上,同样也是一种不容忽视的胜利。