
IT之家 8 月 17 日消息,Arena(arena.ai)平台发布 2026 年第 33 周(8 月 10 日 ~8 月 16 日)AI 大模型盲测排名,本期最大看点是 Anthropic 多款 claude-opus-4 系列新模型密集入榜并占据综合榜前五位,国产模型 kimi-k3-max 排名上升 2 位至综合榜第 12 位,在前端开发榜也保持第 2 位,qwen3.8-max 首次跻身智能体榜 Top 10。国产模型整体仍处于中上游位置,在前端开发等细分领域已经形成对头部海外模型的紧追态势。
IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。
综合榜
本期综合榜头部几乎被 Anthropic 新模型包揽,claude-fable-5 以 1506 分蝉联榜首,新入榜的 claude-opus-4-6-high 以 1505 分紧随其后位列第二,同样新入榜的 claude-opus-4-7-high 以 1502 分排名第三。前三名分数差距均在 5 分以内,属于误差范围内的并列。
谷歌 gemini-3.7-flash-high 作为新模型首次入榜即拿到第 9 名,表现亮眼。国产模型方面,kimi-k3-max 上升 2 位至第 12 名,是排名最高的国产模型。
国产模型整体处于榜单中上游,具体排名如下:
月之暗面 kimi-k3-max 位列第 12 名,ELO 1489 分,较上周上升 2 位;
阿里 qwen3.8-max 位列第 8 名,ELO 1491 分,较上周下降 2 位;
阿里 qwen3.7-max-preview 位列第 26 名,ELO 1474 分,较上周下降 3 位。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-fable-5 | Anthropic | 1506 ±5 | 21533 | $10 / $50 | 1M |
| 2 | 新上榜 | claude-opus-4-6-high | Anthropic | 1505 ±4 | 72516 | $5 / $25 | 1M |
| 3 | 新上榜 | claude-opus-4-7-high | Anthropic | 1502 ±4 | 60331 | $5 / $25 | 1M |
| 4 | - | muse-spark-1.2 (xHigh) | Meta | 1498 ±10 | 3280 | $1.25 / $4.25 | N/A |
| 5 | - | claude-opus-4-6 | Anthropic | 1497 ±3 | 76474 | $5 / $25 | 1M |
| 6 | ↑ 1 | claude-opus-4-7 | Anthropic | 1494 ±4 | 61419 | $5 / $25 | 1M |
| 7 | ↑ 1 | claude-opus-5-high | Anthropic | 1493 ±5 | 20030 | $5 / $25 | 1M |
| 8 | ↓ 2 | qwen3.8-max | Alibaba | 1491 ±8 | 7004 | $2 / $6 | 1M |
| 9 | 新上榜 | gemini-3.7-flash-high | 1490 ±8 | 5744 | $0.75 / $3.57 | 1.05M | |
| 10 | ↓ 1 | claude-opus-5-max | Anthropic | 1489 ±7 | 9679 | $5 / $25 | 1M |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 12 | ↑ 2 | kimi-k3-max | Moonshot | 1489 ±6 | 11969 | N/A | N/A |
| 26 | ↓ 3 | qwen3.7-max-preview | Alibaba | 1474 ±10 | 3717 | $1.48 / $4.43 | 1M |
代码榜
代码榜格局同样由 Anthropic 新模型主导,claude-fable-5 以 1554 分守住榜首位置,新入榜的 claude-opus-4-7-high 和 claude-opus-4-6-high 分别以 1552 分、 1551 分占据第二、第三名,分数差距极小,误差范围内视为并列。kimi-k3-max 稳定在第六名,ELO 分数上涨 2 分,依然是排名最高的国产代码模型。Meta muse-spark-1.2 (xHigh) 排名上升 7 位至第八名,是本周涨幅最大的头部模型。
国产模型在代码榜占据多个中上游席位,具体排名如下:
月之暗面 kimi-k3-max 排名最高,位列第 6 名,ELO 1544 分,排名不变;
阿里 qwen3.8-max 位列第 13 名,ELO 1529 分,较上周下降 5 位;
阿里 qwen3.7-max-preview 位列第 17 名,ELO 1525 分,排名不变;
小米 mimo-v2.5-pro 位列第 25 名,ELO 1520 分,较上周上升 3 位。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-fable-5 | Anthropic | 1554 ±9 | 5817 | $10 / $50 | 1M |
| 2 | 新上榜 | claude-opus-4-7-high | Anthropic | 1552 ±6 | 17272 | $5 / $25 | 1M |
| 3 | 新上榜 | claude-opus-4-6-high | Anthropic | 1551 ±6 | 18894 | $5 / $25 | 1M |
| 4 | ↑ 1 | claude-opus-4-7 | Anthropic | 1548 ±6 | 17423 | $5 / $25 | 1M |
| 5 | ↓ 1 | claude-opus-4-6 | Anthropic | 1547 ±6 | 21341 | $5 / $25 | 1M |
| 6 | - | kimi-k3-max | Moonshot | 1544 ±11 | 3176 | N/A | N/A |
| 7 | 新上榜 | claude-opus-4-8-high | Anthropic | 1533 ±7 | 11417 | $5 / $25 | 1M |
| 8 | ↑ 7 | muse-spark-1.2 (xHigh) | Meta | 1533 ±20 | 947 | $1.25 / $4.25 | N/A |
| 9 | ↑ 2 | claude-opus-5-high | Anthropic | 1531 ±9 | 5433 | $5 / $25 | 1M |
| 10 | ↓ 1 | muse-spark-1.1 | Meta | 1531 ±9 | 5002 | $1.25 / $4.25 | N/A |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 13 | ↓ 5 | qwen3.8-max | Alibaba | 1529 ±13 | 2146 | $2 / $6 | 1M |
| 17 | - | qwen3.7-max-preview | Alibaba | 1525 ±18 | 1120 | $1.48 / $4.43 | 1M |
| 25 | ↑ 3 | mimo-v2.5-pro | Xiaomi | 1520 ±7 | 13986 | $0.44 / $0.87 | 1.05M |
前端开发榜
前端开发榜头部格局稳定,claude-opus-5-max 以 1692 分蝉联第一,国产 kimi-k3-max 以 1674 分保持第二名位置,仅落后 18 分,依然对榜首形成紧逼。阿里 qwen3.8-max 上升 1 位至第三名,ELO 分数 1667 分,深度求索的 deepseek-v4-pro-high-20260813 作为新模型首次入榜即拿到第 10 名,ELO 分数 1584 分,表现不俗。
国产模型在前端开发榜占据多个头部和中上游位置,具体如下:
月之暗面 kimi-k3-max 位列第 2 名,ELO 1674 分,排名不变;
阿里 qwen3.8-max 位列第 3 名,ELO 1667 分,较上周上升 1 位;
智谱 glm-5.2-max 位列第 9 名,ELO 1585 分,较上周下降 2 位;
深度求索 deepseek-v4-pro-high-20260813 新入榜位列第 10 名,ELO 1584 分;
深度求索 deepseek-v4-flash-high 位列第 11 名,ELO 1581 分,排名下降 3 位。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-opus-5-max | Anthropic | 1692 ±9 | 6448 | $5 / $25 | 1M |
| 2 | - | kimi-k3-max | Moonshot | 1674 ±11 | 4546 | $3 / $15 | 1.05M |
| 3 | ↑ 1 | qwen3.8-max | Alibaba | 1667 ±13 | 2855 | $2 / $6 | 1M |
| 4 | ↓ 1 | claude-opus-5-high | Anthropic | 1663 ±9 | 7334 | $5 / $25 | 1M |
| 5 | 新上榜 | grok-4.6-high | SpaceXAI | 1631 ±17 | 1513 | $2 / $6 | 500K |
| 6 | ↓ 1 | claude-fable-5 | Anthropic | 1627 ±8 | 7867 | $10 / $50 | 1M |
| 7 | ↓ 1 | gpt-5.6-sol-xhigh (codex-harness) |
OpenAI | 1622 ±8 | 8595 | $5 / $30 | 1.05M |
| 8 | 新上榜 | gemini-3.7-flash-high | 1587 ±13 | 2543 | $0.75 / $3.57 | 1.05M | |
| 9 | ↓ 2 | glm-5.2-max | Z.ai | 1585 ±8 | 8142 | $1.4 / $4.4 | 1M |
| 10 | 新上榜 | deepseek-v4-pro-high-20260813 | DeepSeek | 1584 ±14 | 2180 | N/A | N/A |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 11 | ↓ 3 | deepseek-v4-flash-high | DeepSeek | 1581 ±12 | 2936 | $0.44 / $1.32 | 1.05M |
| 24 | - | hy3 | Tencent | 1522 ±13 | 2284 | $0.13 / $0.53 | 262.1K |
| 25 | ↓ 4 | seed-2.1-pro-preview | Bytedance | 1522 ±8 | 7121 | N/A | N/A |
| 27 | ↓ 2 | qwen3.7-max-20260517 | Alibaba | 1517 ±8 | 8373 | $1.48 / $4.43 | 1M |
| 29 | ↓ 3 | glm-5.1 | Z.ai | 1510 ±7 | 8817 | $1.4 / $4.4 | 202.8K |
| 30 | ↓ 3 | kimi-k2.6 | Moonshot | 1509 ±7 | 9589 | $0.95 / $4 | 262.1K |
AI 生图榜
AI 生图榜中,gpt-image-2 (medium) 以 1381 分继续稳坐榜首,微软新模型 mai-image-2.6-preview 首次入榜就拿到第二名,ELO 分数 1336 分,直接跻身头部梯队。国产 seedream-5.0-pro 守住第八名,ELO 分数 1258 分,qwen-image-3.0-pro 位列第九名,两者分数差距仅 1 分,在误差范围内并列。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | gpt-image-2 (medium) | OpenAI | 1381 ±5 | 70065 | N/A | N/A |
| 2 | 新上榜 | mai-image-2.6-preview | Microsoft AI | 1336 ±11 | 3488 | N/A | N/A |
| 3 | ↓ 1 | grok-imagine-image-2.0 (low) | SpaceXAI | 1316 ±12 | 2676 | N/A | N/A |
| 4 | ↓ 1 | reve-2.1 | Reve | 1302 ±8 | 7588 | N/A | N/A |
| 5 | ↓ 1 | muse-image | Meta | 1282 ±7 | 15119 | N/A | N/A |
| 6 | ↓ 1 | reve-2.0 | Reve | 1270 ±6 | 14641 | N/A | N/A |
| 7 | ↓ 1 | gemini-3.1-flash-image (nano-banana-2) [web-search] |
1264 ±5 | 29102 | N/A | N/A | |
| 8 | - | seedream-5.0-pro | Bytedance | 1258 ±5 | 28830 | N/A | N/A |
| 9 | ↓ 2 | qwen-image-3.0-pro | Alibaba | 1257 ±9 | 4705 | N/A | N/A |
| 10 | ↓ 1 | mai-image-2.5 | Microsoft AI | 1256 ±4 | 46329 | N/A | N/A |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 17 | ↓ 1 | qwen-image-2.0-pro-2026-06-22 | Alibaba | 1191 ±6 | 12021 | N/A | N/A |
| 30 | ↓ 1 | hunyuan-image-3.0 | Tencent | 1151 ±3 | 173345 | N/A | N/A |
AI 视频榜
AI 视频榜头部迎来新变化,Black Forest Labs 新模型 flux-3-video 首次入榜即拿到第二名,ELO 分数 1496 分,仅落后榜首 gemini-omni-flash 16 分。国产模型 dreamina-seedance-2.0-720p 保持第三名位置,ELO 分数 1478 分,minimax-h3 位列第五名,整体头部格局相对稳定。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | gemini-omni-flash | 1512 ±11 | 15930 | N/A | N/A | |
| 2 | 新上榜 | flux-3-video | Black Forest Labs | 1496 ±17 | 1288 | N/A | N/A |
| 3 | ↓ 1 | dreamina-seedance-2.0-720p | Bytedance | 1478 ±9 | 48355 | N/A | N/A |
| 4 | ↓ 1 | muse-video | Meta | 1457 ±15 | 2176 | N/A | N/A |
| 5 | ↓ 1 | minimax-h3 | MiniMax | 1453 ±14 | 2192 | N/A | N/A |
| 6 | ↓ 1 | happyhorse-1.0 | Alibaba-ATH | 1428 ±13 | 22117 | N/A | N/A |
| 7 | ↓ 1 | sora-2-pro | OpenAI | 1366 ±7 | 45731 | $0 / $0.3 | N/A |
| 8 | ↓ 1 | veo-3.1-audio | 1364 ±14 | 13743 | $0 / $0.4 | N/A | |
| 9 | ↓ 1 | veo-3.1-audio-1080p | 1363 ±10 | 24981 | N/A | N/A | |
| 10 | ↓ 1 | veo-3.1-fast-audio | 1362 ±10 | 39441 | $0 / $0.15 | N/A | |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 14 | ↓ 1 | wan2.7-t2v | Alibaba | 1343 ±8 | 16757 | N/A | N/A |
| 17 | ↓ 1 | wan2.6-t2v | Alibaba | 1333 ±8 | 43230 | N/A | N/A |
| 18 | ↓ 1 | seedance-v1.5-pro | Bytedance | 1256 ±7 | 76001 | N/A | N/A |
| 20 | ↓ 1 | wan2.5-t2v-preview | Alibaba | 1249 ±9 | 27361 | N/A | N/A |
| 29 | ↓ 1 | hailuo-2.3 | MiniMax | 1203 ±6 | 74338 | N/A | N/A |
| 30 | ↓ 1 | hailuo-02-pro | MiniMax | 1198 ±12 | 9392 | N/A | N/A |
智能体榜
智能体榜中,Anthropic 模型继续垄断前三,Claude Opus 5 (High) 以 12.19% 的净提升度守住榜首位置。本次榜单有两款新模型进入前十,其中国产 Qwen3.8 Max 首次入榜即排名第 11 位,净提升度达到 7.61%,任务确认成功率 12.54%,工具幻觉率仅 0.11%,表现非常亮眼。另一款新入榜的 Claude Opus 4.8 (High) 排名第六,净提升度 9.78%。国产 Kimi K3 (Max) 稳定在第五名,净提升度 10.6%,任务确认成功率 15.55%,已经跻身全球智能体第一梯队。
国产模型在智能体榜已有多款进入中上游,具体如下:
月之暗面 Kimi K3 (Max) 位列第 5 名,净提升度 10.60%,任务确认成功率 15.55%,排名不变;
阿里 Qwen3.8 Max 新入榜位列第 11 名,净提升度 7.61%,任务确认成功率 12.54%;
智谱 GLM 5.2 (Max) 位列第 14 名,净提升度 6.74%,较上周下降 2 位;
深度求索 Deepseek V4 Flash (High) (20260731) 位列第 19 名,净提升度 4.04%,较上周上升 2 位。
| 排名 | 较上周 | 模型 | 厂商 | 净提升度 (±CI) | 任务确认成功率 | 好评 / 差评比 | 可控性 |
|---|---|---|---|---|---|---|---|
| 1 | - | Claude Opus 5 (High) | Anthropic | 12.19% ±1.45% | 15.35% ±3.03% | 19.26% ±5.29% | 11.34% ±2.79% |
| 2 | - | Claude Fable 5 (High) | Anthropic | 12.01% ±2.57% | 10.66% ±4.9% | 25.14% ±9.01% | 8.84% ±5.23% |
| 3 | - | Claude Opus 5 (Max) | Anthropic | 11.95% ±1.71% | 17.96% ±3.18% | 19.3% ±6.26% | 6.95% ±3.43% |
| 4 | - | GPT 5.6 Sol (xHigh) | OpenAI | 10.86% ±1.8% | 10.12% ±3.69% | 23.03% ±6.72% | 9.23% ±3.74% |
| 5 | - | Kimi K3 (Max) | Moonshot | 10.6% ±1.04% | 15.55% ±2.06% | 20.31% ±3.78% | 7.8% ±1.91% |
| 6 | 新上榜 | Claude Opus 4.8 (High) | Anthropic | 9.78% ±1.78% | 9.45% ±3.1% | 22.52% ±5.71% | 8.44% ±3.33% |
| 7 | - | GPT 5.5 (xHigh) | OpenAI | 8.9% ±1.03% | 4.97% ±2.18% | 14.61% ±3.62% | 9.17% ±1.92% |
| 8 | 新上榜 | Claude Opus 4.7 (High) | Anthropic | 8.17% ±1.43% | 6.61% ±2.95% | 12.32% ±4.81% | 7.72% ±2.91% |
| 9 | ↑ 2 | GPT 5.5 (High) | OpenAI | 7.73% ±0.97% | 4.03% ±2.04% | 11.62% ±3.39% | 8.59% ±1.79% |
| 10 | - | Claude Opus 4.7 | Anthropic | 7.66% ±1.45% | 5.45% ±3.08% | 11.57% ±4.71% | 9.95% ±2.87% |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 11 | 新上榜 | Qwen3.8 Max | Alibaba | 7.61% ±1.6% | 12.54% ±3.32% | 11.64% ±5.58% | 5.34% ±3.09% |
| 14 | ↓ 2 | GLM 5.2 (Max) | Z.ai | 6.74% ±0.9% | 8.39% ±1.91% | 11.6% ±3.18% | 6.14% ±1.58% |
| 19 | ↑ 2 | Deepseek V4 Flash (High) (20260731) |
DeepSeek | 4.04% ±0.81% | 8.7% ±1.93% | 2.46% ±2.71% | 3.34% ±1.57% |
| 25 | ↓ 2 | Kimi K2.7 Code | Moonshot | 1.08% ±2.15% | 4.43% ±4.55% | 2.74% ±7.27% | 1.76% ±4.86% |
| 26 | ↓ 2 | GLM 5.1 | Z.ai | 0.58% ±0.82% | 1.75% ±1.82% | 0.84% ±2.56% | 1.73% ±1.48% |
| 27 | ↓ 2 | Qwen3.7 Max | Alibaba | 0.2% ±0.87% | 0.34% ±2.13% | 4.24% ±2.67% | 0.03% ±1.52% |
| 28 | ↓ 2 | DeepSeek V4 Pro | DeepSeek | 0.14% ±0.88% | 2.16% ±2.21% | 2.5% ±2.82% | 0.59% ±1.63% |
本周 Arena 榜单最显著的特征是海外厂商 Anthropic 集中发布多款新模型并迅速占据各榜单头部位置,验证了其模型迭代的技术积累;国产模型方面,kimi-k3-max 在综合、代码、前端开发三个核心榜单均稳定在前 15 名,前端开发榜更是稳居第二,qwen3.8-max 在智能体榜首秀即进入 Top 11,整体来看国产大模型在通用能力和智能体领域都在持续推进,与头部海外模型的差距仍在稳步缩小。下周市场预计将有更多国产新模型完成版本迭代,值得持续关注其排名表现。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”