全球基模决战!AI圈休不了十一长假了

全球基模决战!AI圈休不了十一长假了

一水 发自 凹非寺

量子位 | 公众号 QbitAI

现在就预告了——中秋和国庆的13天假期,可能会是今年AI圈最忙最炸的两周。

盆友,别休了,别睡了,找好椅子瘫坐吧。

基模决战周,真要来了!!

硅谷那边已经暗流涌动。

Anthropic的新Claude,灰测动静早就传得沸沸扬扬。

谷歌更是直接,Gemini 4 Pro疑似已经披着马甲,偷偷混进Arena参加摸底考试了。

国内这边,全卡在假期前疯狂憋大招。

Kimi开始拿K3.1疯狂打哑谜,DeepSeek下一张Pro牌已经提前写进官方文档,Qwen4也直接亮出了新架构。

而擂台正中央,OpenAI月初才刚刚放出GPT-6 Astra——一款让OpenAI提前给AGI开香槟的基模。

好家伙,这架势整得像大家提前约好了一样:

该来的、可能来的、偷偷摸摸已经在考场里的,全赶到了一块儿

节前最后一舞,Are you ready?

硅谷集体围攻OpenAI GPT-6 Astra

硅谷这边,A社、谷歌、马斯克的Grok几乎都有新动作传出。

A社Claude 5.2箭在弦上

最先坐不住的自然还是A社。

路透社最新爆料已经确认,Anthropic正在考虑推出一款新模型,只是最终什么时候发、叫什么,还没公开。

社区里呼声最高的是Claude Opus 5.2和Fable 5.2

这两款模型之所以被社区盯上,主要还是因为最近冒出来的一系列灰测信号。

最早的线索来自Claude Code。

有开发者发现,自己明明选择的还是Opus 5,但部分复杂任务里的表现却和此前版本明显不同。

于是社区开始猜测:

Anthropic是不是已经在后台悄悄切换模型,把一部分请求路由到了新的内部checkpoint?

这个猜测很快被更多线索印证。

多位开发者反馈,原本调用Fable 5.1的请求,在后台被静默重定向到了新版本。

有人在高推理模式下实测,发现新模型的输出质量明显优于GPT-6 Astra,代价是速度更慢、成本更高。

最戏剧性的当属Opus 5.2的午夜惊魂。

9月17日晚间,Anthropic突然切断了Opus-Next(据传是Opus 5.2的内部代号)的灰度测试通道,活跃测试账号一度归零,开发者社区一片哀嚎。

但仅仅一天之后,灰测就重新上线,范围还从Claude Code扩大到了Chat和Cowork。

而这一系列动作的大背景是:

OpenAI月初发布的GPT-6 Astra,已经拿下了约13%的企业AI支出,Anthropic的Claude Fable则约为8%。

Anthropic选择在IPO前夕放出新模型的风声,很难说不是在抢回叙事主动权。

谷歌Gemini 4 Pro内测效果刷屏

更有节目效果的是谷歌。

最近Arena里出现了一个名叫gemini-3.8-flash的模型。

名字看着平平无奇,但不少测试者很快发现不对劲:

这玩意儿根本不像Flash

众人一致推断,它很可能是谷歌下一代旗舰Gemini 4 Pro的隐身checkpoint,社区还流传其内部代号为Argon

随后冒出来的一堆demo,更是直接把讨论度拉起来了。

AI圈祖传考题鹈鹕骑自行车,这次疑似Gemini 4 Pro的版本,不只是把鸟和自行车画出来,还进一步做成了带踩踏动作、光照变化和控制组件的完整交互页面。

相比普通3.8 Flash,复杂度肉眼可见地高了一截。

再比如画PS5 SVG,模型花了大约10分钟,直接用代码画出一套细节非常密的PS5矢量图,包含复杂曲线、阴影和机身结构。

测试者直接评价,这是自己从AI模型里拿到过最夸张的输出之一。

还有Voxel Pagoda(体素宝塔),这次模型直接搭了一个完整3D场景:

多层宝塔、地形、树木和周边环境一起生成,同时还保留了查看和灯光控制。

相比之前checkpoint,几何结构和整个场景的完整度明显提高。

以及一个传播很广的demo侧视家猫SVG,提示词非常简单:

画一只侧视的家猫。

测试者把疑似Gemini 4 Pro的结果和GPT-6 Astra Max、正式版Gemini 3.8 Flash摆在一起,主要看轮廓、四肢比例和空间关系(下图按此顺序)。

结果也因此在Reddit拿到了数百赞,成了这一波最火的对比图之一。

再往后,测试已经从SVG一路卷到了网页和3D场景。

有网友甚至用它做了一个奥特曼骑哥斯拉打怪兽小游戏:

SVG+HTML,鼠标点哪里就往哪里发射激光,还能加速。

当然,这些demo只能说明Arena里这个神秘checkpoint确实很能打。

它到底是不是Gemini 4 Pro,谷歌没官宣之前还得打个问号,但至少从测试密度来看——

下一代Gemini,已经离得很近了

马斯克Grok 4.7正在烹制中

马斯克也没闲着。

此前有网友询问Grok 4.7进展,老马直接回复:

Grok 4.7 needs a few more days to cook.

掐指一算,也差不多这几天了。

不过按老马以前的风格,他一般是等其他人都发了再出现,主打一个黄雀在后(doge)。

买定离手,我先压一个。

国内热闹程度也不遑多让

国内这边,有人已经提前抢跑了——

就在刚刚,阶跃星辰突然发布新一代旗舰模型Step 5 Preview

模型采用稀疏MoE架构,总参数600B、激活参数27B,支持百万Token上下文,并针对编程、Agent、专业知识工作等真实任务进行了优化。

在全球权威的Artificial Analysis Intelligence Index中,Step 5 Preview取得44分,位居全球开源模型前三,而且单任务成本仅为Claude Opus 5的1/8。

而阶跃刚把牌拍上桌,Kimi那边的谜底也已经快写脸上了。

最近其官方账号最近突然放出一串数字:415926535897932384626433832795……

乍一看像乱码,但把圆周率π拿出来对照一下就懂了。

π开头是:

3.1415926535897932384626433832795……

去掉最前面的3.1,剩下的刚好就是这串数字。

K3.1??好好好,是谁又悟了~(不过也有网友反手买,说这意味着没有3.1)

除了Kimi,DeepSeek这边也早就埋好了彩蛋。

9月10日发布DeepSeek V4.1 Flash时,官方文档里已经明确提到:

在V4.1 Pro上线之前,部分V4 Pro请求会被路由到V4.1 Flash

换句话说,V4.1 Pro基本确定存在,只差什么时候翻牌。

而按以前发布节奏推测,V4.1 Pro最快可能会落在9月底到10月初这个窗口期。

Flash和Pro之间通常不会拖太久,此前V4系列发布时,Flash和Pro基本同步亮相。

更早的版本迭代中,轻量版本先行后,旗舰版本也往往会在数周内跟进。

再加上放假这个因素,一放假就发模型的戏码想必大家也不陌生了。

再往后是阿里Qwen。

阿里8月底开源Qwen3.8-Flash-Next时也把话挑明了:

这就是Qwen4底层架构的early preview

而且官方强调,这次之所以提前把架构开出来,就是想让社区在完整Qwen4系列构建完成之前先行测试。

换句话说,Qwen4同样已经在路上。

现在,太平洋两岸的选手已经严阵以待,就看谁先出牌了。

当然,有新模型要发的要加班,没有新模型发的可能更要加班。

还讨论什么AI代替工作、AI自我进化RSI……咱这行一直都是一部分人铆足了劲,要么让另一部分人失业,要么让另一部分人加班。

十一假期,Are you ready?

参考链接:

[1]https://x.com/MaxForAI/status/2101254889296781439

[2]https://x.com/kimmonismus/status/2101268494901792968

[3]https://x.com/kimmonismus/status/2101226451861180711

[4]https://x.com/LuminaBench/status/2101359620472115598