DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵

DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵

作者:丸美小沐

家人们,DeepSeek V4.1 Flash开启内测了。

内测问卷里有道题,把我看乐了。官方直接问,这个模型能不能全面替换线上的DeepSeek V4 Pro。

上次我测完V4 Pro,结论是低于预期,不推荐接入Codex。

这回官方自己都开始问,Flash能不能接Pro的班了。

Pro,你这家庭地位,好像也没那么稳啊。

玩笑归玩笑,这次到底升级了多少,还是得跑起来看看。

这次内测通知,V4.1 flash是中间版本内测,采用了新的模型结构、支持原生多模态,能力更强、速度更快。

我按照官方的教程,第一时间把新模型接入了deepseek harness进行了深度实测。

这次,我也把旧版V4 Flash拉过来,用同样的提示词跑了14组任务,放在一起对照。

光V4.1就累计跑了3亿Token。

这轮测下来,最明显的进步,确实是原生多模态带来的。它终于能自己看图了,还开始嫌自己画得丑。。

但速度、交付和花钱这几件事,比刚开测时想的复杂。

模型吐字更快,但交付却未必更快。

写到这里,官方又公布了一个新消息:9月10日中午12点起,Flash系列降价,缓存命中输入的单价直接砍掉60%。

价格更香了。不过,我这轮测试发生在降价之前,当时两版计费相同,V4.1的测试账户却花得更多。

钱花在哪儿,时间又耗在哪儿?跟大家展开聊聊。

◈一、原生多模态,少绕很多弯路

先说最直接的感受吧,V4.1看图明显顺了。

我把同一张图交给两个模型,让它们解释内容。其中一组,V4.1大约5.7秒就答完了,V4花了200秒。

另一组图片描述,V4.1用了7.6秒,V4跑了751秒,十二分多钟。

差距主要出在后面的过程。

V4.1能直接地说出图里有什么。旧Flash在这套接入环境里,经常要先跑OCR,再分析像素和颜色,想办法从工具结果里拼出图片内容。

工具用了不少,结果还未必对。

同一张海报,V4.1认出了黄牛,也读到了图里的OX。

V4 Flash虽然已经读到OX的碎片,但它最后还是把海报上的字猜成了WINTER,黄牛也没认出来。

总之,短视觉任务的优势很明显,省掉了找工具猜图片的过程。

我又丢了经典的鹈鹕骑自行车。

以前做这种题,经常是模型宣布完成,我打开一看,问题一堆。

这次,V4.1可以自检和迭代纠错。

画鹈鹕时,V4.1发现画出来更像一只带着碗的天鹅,就又去改头部、鸟喙和骑车的姿势。

另一个小熊任务,它嫌脖子太长、脑袋太小,已经有点像羊驼了,于是继续调整。

当然,知道哪里丑,也不保证每次都改到位。最终图里,远处那只脚和车链的遮挡、翅膀与车把的接触,仍然有值得挑的地方。

3D武装飞机是这批视觉作品里我很喜欢的一个。

金属机身配上周围的参数面板,第一眼就有点正式模型展示页的意思。

转动视角,反光会沿着机身变化;拉近看,尾喷、起落架和机翼挂载都有结构。点一下开关,起落架还真能收回去,挂载也能隐藏。

画面有质感,操作也有反馈。

上次测V4 Pro,我对前端效果是失望的。

这次这架飞机,确实把我的预期拉回来了一点。

◈二、它能把图片里的信息,变成游戏里的数据

看懂图片是第一步。接下来测试【视觉推理】能力。

图片里的位置和规则,它能不能一起读懂?我准备了三张参考图……

一张青蓝色水獭邮递员,一张包裹和投递标记,还有一张5×5的关卡布局,基于三张图片,任务是:做一个《星光邮局》游戏。

玩法是,把推箱子和图案配对拼在一起。玩家控制邮递员,把包裹推到对应的投递格里,一共三关,再加上撤销、存档和导出明信片。

结果还挺能说明问题。

V4.1保留了水獭的青蓝色身体、深蓝帽子和橙色邮包。更关键的是,玩家、障碍、包裹和目标格的位置,都能与参考图对上。

V4却理解错了,它做成了7×7,角色变成了橙衣小人。

我查了任务记录能看到,V4这一路的图像工具返回过不支持图片,随后它转去做程序化分析。走着走着就分析偏了。

同样给三张图作为输入,V4.1首先能正确保持图片不变形,把图片里的位置关系写进游戏规则,然后游戏逻辑和执行都正确。

◈三、数据处理能力依据很强,前端进步明显

纯数据任务里,V4仍然交出了不少可用的结果。

我让它们做A股全市场热力图,两边都把5557条本地行情快照整理成了树图。搜索000001,都能下钻到深市主板,再定位平安银行。

V4.1的格子里,股票名称和代码显示得更完整;V4顶部做了不同板块的独立入口。基本的数据整理、搜索和页面组织,旧Flash还是能做的。

另一个任务更有意思,我让它们做一个可以玩的数学展品。

这个展品叫孪生素数星系图。

孪生素数就是相差2的两个质数,比如3和5、11和13。我要求模型把千万以内的全部结果算出来,每一对画成两个相邻的光点,中间用细线连接,再沿着螺旋向外铺开,做成一片星系。

我还要求,输入其中一个质数后,结果列表和星系画面都要定位到对应的那一对。

最终,两个模型都给出了58980对,第一对是3和5,最后一对是9999971和9999973。

两边的计算结果都没问题。

但当数据遇上可视化,差别出来了。

V4.1的螺旋星系能显示。输入9999971,结果列表跳到最后,画面里也出现对应的两个光点和连线。

V4的文字结果是对的,页面还告诉我已经定位,但中央主画布依然是一片黑。

这道题让我对V4.1的前端进步更有感受,对细节把控更精准了。

它把数据、图形和搜索动作接得更完整。旧Flash的计算部分没有掉队,最后交到浏览器里的效果,却可能差一截。

◈四、吐字快,交活未必快

速度依然有惊喜。

开测初期,我截了一次这14组并发任务的日志。按当下的测试时间累计输出和生成时间计算,V4.1大约284 Token/s,V4大约97 Token/s,接近三倍。

刚开始看它跑,Flash那种利索的感觉确实回来了。

不过到了后半程,这个优势没有一直保持。差距收窄,部分长任务也越来越磨人。

是不是大家都开始测,服务器压力上来了?我有这个怀疑,但目前还不能确认。

更让我意外的,是前面那个《星光邮局》。

同样做完一个三关小游戏,V4.1用了约34.5分钟,V4用了约30.5分钟。V4.1的输出还更少,约11.3万Token,对面约15万。

拆开日志看,在V 4.1生成代码花费的时间确实更少。

整个任务下来,模型工作了大约15.5分钟,相比之下V4用了23.4分钟。

但如果只看模型等待工具运行的时间,时间差倒过来了。V4.1累计约18.7分钟,V4约6.6分钟。

几次关卡布局搜索,就花了超过十分钟。

它把生成代码省下来的时间,又花到调用工具验证去了。

当然,这些时间也不全是白花的。测试和修正之后,关卡更贴近参考图。

可站在等结果的人这边,等待时间就是更长。

游戏里,有些时间花在找解法和验证上。回测任务里,则有些时间是在给自己修Bug。

代码写得快,前面埋下的问题,后面还是得花时间补。

◈五、长上下文能力有待提升

除了看图和写代码,我还想看看,它写长篇的水平有没有一起涨。

我只给了一句话灵感,让两个模型各写一部十万字网文。

宗门废柴扫地十年,扫出上古大能的道场;掌门跪在门口求他出关,他说,再扫十年。

两边都交了稿。V4.1写了25章、约10.67万字,V4写了51章、约9.74万字。

把两边开头、中段、转折和结尾共27章抽出来细读之后,这次写网文,我反而更喜欢旧Flash。

V4的节奏很快。少年上山、比武出头、强敌围山,隔一段就有新进展。

V4.1的笔墨更多,节奏却慢了下来。同一个扫地动作,能来回写好几遍。细节是多了,但我更想知道后面发生了什么,读着读着就想往下翻。

更离谱的是,有一处刚写到扫第五趟,下一段又回到了第四趟。同一晚,自己把遍数记乱了。。

两段原文放在一起,旧Flash的情绪表达更直接。放在这次网文题里,我读起来也更顺。

但旧版也有穿帮。前一章,主角体内的万尘珠已经长出了第七片嫩叶;下一章,写着写着又成了五六片。

一个把扫地的遍数记乱,一个把叶子的数量记乱。长篇都能往下写,前后能不能对得上,还是另一回事。

这种前后对不上的问题,到了报告里就更扎眼了。

前面提到的A股回测任务,我让它们用科技股近两年的行情模拟买卖,希望收益超过10%,最大回撤控制在10%以内,最后把结果和图表整理成报告。

回测就是拿历史行情模拟交易。收益看赚了多少,最大回撤看账户曾经从高点跌下去多少。

V4.1做出的报告看着挺完整,13张图表都能加载。

可首页写年化15.1%,往下看,同一份报告里的图还标着17.8%,总收益和最大回撤也没有统一。

摘要和图表没有用上同一套数字。

综合看下来,长上下文能力,还是有待进步的。

◈六、V4.1的总花费反而更多

最后算一下钱。

14个任务完成,V4.1的后台记录是2485次API请求,累计约3亿Token,输入缓存命中率约98.9%。

这3亿里,绝大部分是多轮请求反复带上的缓存输入,不是新生成了3亿Token的内容。

消费61.96元。

相比之下,V4对照账户消费45.47元。V4.1反而多花了16.49元,约36%。

怎么还贵了,钱到底花哪儿了?

我把两边的任务日志连同子Agent一起翻了一遍,发现这轮V4.1更爱给自己找帮手。有些活看着只有一个模型在跑,背后已经开了一整个团队。

额外开销最集中的,是大型游戏和十万字小说这两题。这里的大型游戏,是同时要求做木筏求生和孢子五阶段的那道题。

V4 Flash主要在一个会话里往下写,V4.1则派出了13个子Agent,把各个模块分别委托出去,自己负责组织和整合。

算上所有子任务,这道题V4.1用了约1.21亿Token,V4 Flash约3653万。

十万字小说这一题,更能看出它的做事习惯。

V4.1给自己组了一个写作团队。前24章,一章派一个Agent。自己写设定集、章纲和最后一章。

每个写手先读三份统一材料,再按四千多字的要求开写。写完查字数,按规范修改。最后主模型又让其中9章扩写。

光第22章,最终约4,253个汉字,中间就花了71,328个输出Token。

还有一个小细节挺有意思。

主Agent让第21章补字数,说它只有3,847字。子Agent重新检查,文件已经有4,319字了,还特意指出不是3,847。但它仍按追加要求,继续往目标区间的上限补。

团队大了,连交接时的字数都可能没对上。。

主Agent要求补字数,原始日志截图

子Agent核数后继续修改,原始日志截图

相比之下,V4 Flash在一个会话里,老老实实一章接一章写。

小说这一题,V4.1的总Token比旧Flash多了约17%,输出Token也是旧Flash的4.5倍。

游戏加小说,V4.1在两个任务里累计开了37个子Agent。仅这些子任务,就用了超过一亿Token。

V4.1在复杂任务上,更倾向开多Agent。

但分出去的每一章、每一块代码,都要重新读材料、写内容、做检查,最后还得接到一起。并行能让几路工作同时推进,也会多出交接和返工。

这些中间工作,最后都会进账单。

不过,V4.1也有明显更省Token的任务。

飞机建模这一题,它用了约897万Token,旧Flash约1849万。《星光邮局》则是约805万对1461万,少了约45%。

偏偏《星光邮局》,又是它交活更慢的那一道题。。

最后说下测试结论:

V4.1视觉理解相比V4进步明显;

V4.1复杂任务更容易开多Agent,token消耗多;

数分和报告工程上,和V4几乎没有区别;

非视觉端到端任务的完成时间没有明显变化(dsh内);

长上下文理解能力尚有进步空间;