AI大模型周榜:阿里千问3.8-Max空降综合前五,字节即梦5.0生图第六
科技
科技 > 人工智能 > 正文

AI大模型周榜:阿里千问3.8-Max空降综合前五,字节即梦5.0生图第六

IT之家 8 月 3 日消息,Arena(arena.ai)平台 AI 大模型 2026 年第 31 周排行榜发布,本期统计周期为 2026 年 7 月 27 日至 8 月 2 日。

本周榜单迎来大量新模型更新,国产模型亮点突出:阿里 qwen3.8-max 首次亮相即杀入综合榜 Top 5,月之暗面 kimi-k3-max 位列综合榜第 13 名,字节跳动 seedream-5.0-pro 排名大幅上升 5 位进入 AI 生图榜 Top 6,多款国产模型在细分榜单取得亮眼成绩。整体来看,本周国产模型在头部梯队占位进一步提升,与海外顶级模型差距继续缩小。

综合榜

本周综合榜头部几乎被 Anthropic 新品包揽,claude-fable-5 以 1509 分蝉联榜首,第二到第四名分别为 claude-opus-4-6-thinking ( 1505 分)、 claude-opus-4-7-thinking ( 1502 分)、 claude-opus-4-6 ( 1497 分),分数差距均在 30 分以内,在统计误差范围内视为接近。阿里最新发布的 qwen3.8-max 以 1496 分位列第 5 名,仅比榜首低 13 分,成为目前排名最高的国产模型,表现极为突出。

国产模型在本次综合榜已有多款进入前 25 名,梯队分布如下:

阿里 qwen3.8-max 排名第 5,ELO 1496 分,为本次新入榜模型;

月之暗面 kimi-k3-max 排名第 13,ELO 1485 分,本次新入榜;

阿里 qwen3.7-max-preview 排名第 22,ELO 1475 分,排名持平。

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 🇺🇸 claude-fable-5 Anthropic 1509 ±6 17799 $10 / $50 1M
2 🇺🇸 claude-opus-4-6-thinking Anthropic 1505 ±4 67203 $5 / $25 1M
3 🇺🇸 claude-opus-4-7-thinking Anthropic 1502 ±4 54781 $5 / $25 1M
4 🇺🇸 claude-opus-4-6 Anthropic 1497 ±4 70970 $5 / $25 1M
5 🇨🇳 qwen3.8-max 阿里 1496 ±10 3327 $2 / $6 1M
6 🇺🇸 claude-opus-4-7 Anthropic 1492 ±4 55992 $5 / $25 1M
7 🇺🇸 claude-opus-5-high Anthropic 1492 ±6 10704 $5 / $25 1M
8 🇺🇸 claude-opus-5-max Anthropic 1490 ±9 5124 $5 / $25 1M
9 🇺🇸 muse-spark-1.1 Meta 1490 ±6 12086 $1.25 / $4.25 N/A
10 🇺🇸 muse-spark Meta 1488 ±6 13486 N/A N/A
— 以下为 Top 10 外的国产模型 —
13 🇨🇳 kimi-k3-max 预发布 月之暗面 1485 ±10 3556 $3 / $15 1.05M
22 🇨🇳 qwen3.7-max-preview 预发布 阿里 1475 ±10 3695 $1.48 / $4.43 1M

代码榜

代码榜方面,claude-fable-5 以 1553 分从第二名升至榜首,claude-opus-4-7-thinking 以 1552 分紧随其后,两款模型分差仅 1 分,在统计误差范围内并列。头部前 8 名中,阿里 qwen3.8-max 以 1530 分位列第 10 名,月之暗面 kimi-k3-max 同样以 1531 分排在第 8 名,国产模型首次有两款同时杀入代码榜 Top 10,进步显著。

国产模型在代码榜的具体排名如下:

月之暗面 kimi-k3-max 排名第 8,ELO 1531 分,本次新入榜,预发布状态;

阿里 qwen3.8-max 排名第 10,ELO 1530 分,本次新入榜,预发布状态;

阿里 qwen3.7-max-preview 排名第 17,ELO 1525 分,排名持平;

智谱 glm-5.1 排名第 28,ELO 1518 分,较上周下降 7 位;

小米 mimo-v2.5-pro 排名第 29,ELO 1518 分,排名下降 5 位。

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 🇺🇸 claude-fable-5 Anthropic 1553 ±9 4823 $10 / $50 1M
2 🇺🇸 claude-opus-4-7-thinking Anthropic 1552 ±6 15649 $5 / $25 1M
3 🇺🇸 claude-opus-4-6-thinking Anthropic 1551 ±6 17433 $5 / $25 1M
4 🇺🇸 claude-opus-4-6 Anthropic 1548 ±6 19814 $5 / $25 1M
5 🇺🇸 claude-opus-4-7 Anthropic 1547 ±6 15915 $5 / $25 1M
6 🇺🇸 claude-opus-4-8-thinking Anthropic 1534 ±7 9830 $5 / $25 1M
7 🇺🇸 claude-opus-5-high Anthropic 1532 ±12 2918 $5 / $25 1M
8 🇨🇳 kimi-k3-max 预发布 月之暗面 1531 ±20 947 $3 / $15 1.05M
9 🇺🇸 claude-opus-4-5-20251101-thinking-32k Anthropic 1530 ±7 7606 $5 / $25 200K
10 🇨🇳 qwen3.8-max 预发布 阿里 1530 ±19 991 $2 / $6 1M
— 以下为 Top 10 外的国产模型 —
17 🇨🇳 qwen3.7-max-preview 预发布 阿里 1525 ±18 1113 $1.48 / $4.43 1M
28 🇨🇳 glm-5.1 智谱 1518 ±7 9822 $1.4 / $4.4 202.8K
29 🇨🇳 mimo-v2.5-pro 小米 1518 ±7 12665 $0.44 / $0.87 1.05M

前端开发榜

前端开发榜中,claude-opus-5-max 以 1705 分守住榜首位置,月之暗面 kimi-k3-max 以 1676 分位列第二,阿里 qwen3.8-max 以 1668 分排名第四,国产模型共有三款进入 Top 8,占据半壁江山。kimi-k3-max 仅落后榜首 29 分,在统计误差范围内与头部海外模型非常接近。

国产模型整体处于中上游,具体排名如下:

月之暗面 kimi-k3-max 排名第 2,ELO 1676 分,预发布状态;

阿里 qwen3.8-max 排名第 4,ELO 1668 分,预发布状态;

智谱 glm-5.2-max 排名第 7,ELO 1586 分;

字节跳动 seed-2.1-pro-preview 排名第 19,ELO 1527 分,预发布状态;

阿里 qwen3.7-max-20260517 排名第 23,ELO 1517 分。

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 🇺🇸 claude-opus-5-max Anthropic 1705 ±15 2192 $5 / $25 1M
2 🇨🇳 kimi-k3-max 预发布 月之暗面 1676 ±12 4366 $3 / $15 1.05M
3 🇺🇸 claude-opus-5-high Anthropic 1669 ±11 3873 $5 / $25 1M
4 🇨🇳 qwen3.8-max 预发布 阿里 1668 ±18 1563 $2 / $6 1M
5 🇺🇸 claude-fable-5 Anthropic 1630 ±9 6310 $10 / $50 1M
6 🇺🇸 gpt-5.6-sol-xhigh (codex-harness) OpenAI 1620 ±9 6000 $5 / $30 1.05M
7 🇨🇳 glm-5.2-max 预发布 智谱 1586 ±9 6361 $1.4 / $4.4 1M
8 🇨🇳 deepseek-v4-flash-high 预发布 深度求索 1577 ±18 1319 $0.14 / $0.28 1.05M
9 🇺🇸 claude-opus-4-8-thinking Anthropic 1566 ±8 8934 $5 / $25 1M
10 🇺🇸 claude-opus-4-7 Anthropic 1561 ±7 11755 $5 / $25 1M
— 以下为 Top 10 外的国产模型 —
19 🇨🇳 seed-2.1-pro-preview 预发布 字节跳动 1527 ±9 5513 N/A N/A
23 🇨🇳 qwen3.7-max-20260517 阿里 1517 ±8 7840 $1.48 / $4.43 1M
24 🇨🇳 hy3 预发布 腾讯 1517 ±17 1491 $0.13 / $0.53 262.1K
25 🇨🇳 glm-5.1 预发布 智谱 1516 ±8 7377 $1.4 / $4.4 202.8K
26 🇨🇳 kimi-k2.6 预发布 月之暗面 1510 ±8 9256 $0.95 / $4 262.1K
30 🇨🇳 minimax-m3 预发布 MiniMax 1491 ±8 8155 $0.6 / $2.4 N/A

智能体榜

智能体榜采用百分比信号评分体系,本周 Claude Fable 5 (High) 以 12.58% 的净提升度稳居第一,Claude Opus 5 (Max) 和 Claude Opus 5 (High) 分列二三位,头部格局基本稳定。Anthropic 旗下模型占据前七名中的五席,在智能体任务领域仍保持明显优势。工具幻觉率最低的模型是腾讯 hy3 ,仅为 0.33% ,可控性最强的模型是 Nemotron 3 Ultra,达到 20.73% 。

国产模型在智能体榜的排名和净提升度如下:

MiniMax minimax-m3 排名第 33 名,净提升度 2.55% ,任务确认成功率 5.67%;

深度求索 DeepSeek V4 Flash 排名第 34 名,净提升度 2.96% ,任务确认成功率 4.9%;

小米 Mimo V2.5 Pro 排名第 32 名,净提升度 2.52% ,任务确认成功率 3.81%;

阿里 Qwen3.7 Max 排名第 25 名,净提升度 0.53% ,任务确认成功率 1.95%;

月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 9.91% ,任务确认成功率 14.23%,进入智能体榜 Top 5。

排名 模型 厂商 净提升度 (±CI) 任务确认成功率 好评 / 差评比 可控性 会话数
1 🇺🇸 Claude Fable 5 (High) Anthropic 12.58 ±2.19 10.26 24.42 12.93 23807
2 🇺🇸 Claude Opus 5 (Max) Anthropic 11.88 ±2.81 17.56 25.63 1.81 7253
3 🇺🇸 Claude Opus 5 (High) Anthropic 11.73 ±1.66 16.6 24.4 5.49 11114
4 🇺🇸 GPT 5.6 Sol (xHigh) OpenAI 10.02 ±1.63 8.61 21.9 8.96 16966
5 🇺🇸 Kimi K3 (Max) 月之暗面 9.91 ±1.19 14.23 17.45 9.67 19586
6 🇺🇸 Claude Opus 4.8 (Thinking) Anthropic 9.43 ±1.64 8.75 21.05 9.77 34477
7 🇺🇸 Claude Sonnet 5 (High) Anthropic 8.57 ±2.0 7.95 16.12 6.74 24657
8 🇺🇸 GPT 5.5 (xHigh) OpenAI 8.49 ±0.95 5.82 12.91 8.24 43122
9 🇺🇸 Claude Opus 4.7 (Thinking) Anthropic 8.19 ±1.26 6.19 11.2 9.65 35471
10 🇺🇸 GPT 5.5 (High) OpenAI 7.89 ±0.88 5.63 11.31 9.18 68340
— 以下为 Top 10 外的国产模型 —
19 🇨🇳 Claude Opus 4.8 Anthropic 3.34 ±1.94 8.24 12.75 8.39 32551
20 🇨🇳 Claude Sonnet 4.6 Anthropic 3.18 ±1.2 0.07 0.88 2.39 35966
23 🇨🇳 Kimi K2.7 Code 月之暗面 0.44 ±1.82 4.73 3.42 3.71 10359
25 🇨🇳 Qwen3.7 Max 阿里 0.53 ±0.97 1.95 5.89 0.2 20914
26 🇨🇳 DeepSeek V4 Pro 深度求索 0.78 ±0.94 3.61 5.37 0.39 21459
27 🇨🇳 hy3 腾讯 1.03 ±1.88 1.55 2.83 8.17 8506
29 🇨🇳 Kimi K2.6 月之暗面 1.09 ±1.95 3.1 1.58 4.9 10436
30 🇨🇳 gemini-3.6-flash 谷歌 1.59 ±2.68 0.15 6.2 2.59 2532
31 🇨🇳 Qwen3.7 Plus 阿里 1.65 ±1.29 1.72 7.98 4.63 14112
32 🇨🇳 Mimo V2.5 Pro 小米 2.52 ±1.01 3.81 8.05 2.11 21399
33 🇨🇳 Minimax M3 MiniMax 2.55 ±0.93 5.67 9.01 4.56 20996
34 🇨🇳 DeepSeek V4 Flash 深度求索 2.96 ±0.95 4.9 8.38 3.98 20775
41 🇨🇳 Minimax M2.7 MiniMax 11.59 ±1.17 14.67 15.74 14.94 21221

AI 生图榜

AI 生图榜本周最大亮点是字节跳动 seedream-5.0-pro 排名大幅上升 5 位,从第 11 名升至第 6 名,ELO 分数达到 1257 分,仅落后榜首 gpt-image-2 (medium) 124 分,成功杀入 Top 6,成为排名最高的国产 AI 生图模型。另有多款国产模型进入前 30 名,hunyuan-image-3.0 排名第 25,seedream-4.5 排名第 28,整体表现稳定。

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 🇺🇸 gpt-image-2 (medium) OpenAI 1381 ±5 66665 N/A N/A
2 🇺🇸 reve-2.1 Reve 1300 ±8 6131 N/A N/A
3 🇺🇸 muse-image Meta 1281 ±7 13261 N/A N/A
4 🇺🇸 reve-2.0 Reve 1270 ±6 14563 N/A N/A
5 🇺🇸 gemini-3.1-flash-image (nano-banana-2) [web-search] 谷歌 1263 ±6 25351 N/A N/A
6 🇨🇳 seedream-5.0-pro 预发布 字节跳动 1257 ±6 20977 N/A N/A
7 🇺🇸 mai-image-2.5 Microsoft AI 1254 ±5 41589 N/A N/A
8 🇺🇸 gemini-3.1-flash-lite-image (nano-banana-2-lite) 谷歌 1251 ±6 16201 N/A N/A
9 🇺🇸 gemini-3-pro-image-2k (nano-banana-pro) 谷歌 1246 ±3 135981 N/A N/A
10 🇺🇸 gpt-image-1.5-high-fidelity OpenAI 1239 ±3 139642 N/A N/A
— 以下为 Top 10 外的国产模型 —
14 🇨🇳 qwen-image-2.0-pro-2026-06-22 预发布 阿里 1191 ±6 11952 N/A N/A
25 🇨🇳 hunyuan-image-3.0 预发布 腾讯 1151 ±3 172741 N/A N/A
28 🇨🇳 seedream-4.5 预发布 字节跳动 1147 ±3 229805 N/A N/A
30 🇨🇳 seedream-4-2k 预发布 字节跳动 1140 ±7 12599 N/A N/A

AI 视频榜

AI 视频榜头部格局稳定,gemini-omni-flash 以 1513 分继续排名第一,字节跳动 dreamina-seedance-2.0-720p 以 1479 分守住第二的位置,阿里 happyhorse-1.0 以 1428 分排名第四,两款国产模型稳居前五,表现稳定。国产模型共有 7 款进入前 30,整体占据中上游位置。

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 🇺🇸 gemini-omni-flash 谷歌 1513 ±12 14571 N/A N/A
2 🇨🇳 dreamina-seedance-2.0-720p 预发布 字节跳动 1479 ±11 47067 N/A N/A
3 🇺🇸 muse-video Meta 1458 ±15 2160 N/A N/A
4 🇨🇳 happyhorse-1.0 预发布 阿里 1428 ±13 21979 N/A N/A
5 🇺🇸 sora-2-pro OpenAI 1365 ±8 44543 $0 / $0.3 N/A
6 🇺🇸 veo-3.1-audio 谷歌 1364 ±14 13687 $0 / $0.4 N/A
7 🇺🇸 veo-3.1-audio-1080p 谷歌 1363 ±10 24846 N/A N/A
8 🇺🇸 veo-3.1-fast-audio 谷歌 1362 ±11 39301 $0 / $0.15 N/A
9 🇺🇸 veo-3.1-fast-audio-1080p 谷歌 1358 ±10 25637 N/A N/A
10 🇺🇸 grok-imagine-video-720p SpaceXAI 1349 ±8 151774 N/A N/A
— 以下为 Top 10 外的国产模型 —
12 🇨🇳 wan2.7-t2v 预发布 阿里 1347 ±9 15246 N/A N/A
15 🇨🇳 wan2.6-t2v 预发布 阿里 1330 ±9 41706 N/A N/A
16 🇨🇳 seedance-v1.5-pro 预发布 字节跳动 1256 ±7 75653 N/A N/A
18 🇨🇳 wan2.5-t2v-preview 预发布 阿里 1252 ±10 25895 N/A N/A
27 🇨🇳 hailuo-2.3 预发布 MiniMax 1202 ±7 72127 N/A N/A
28 🇨🇳 hailuo-02-pro 预发布 MiniMax 1198 ±13 9365 N/A N/A
29 🇨🇳 seedance-v1-pro 预发布 字节跳动 1190 ±11 12117 N/A N/A
30 🇨🇳 hailuo-02-standard 预发布 MiniMax 1180 ±12 9333 N/A N/A

总结来看,本周 Arena AI 大模型周榜迎来密集更新,大量新模型首次入榜,国产模型整体取得突破性进展:阿里 qwen3.8-max 首次亮相即杀入综合榜 Top 5,代码榜和前端开发榜也均有国产模型进入 Top 10;字节跳动 seedream-5.0-pro 大幅提升排名进入 AI 生图榜 Top 6;AI 视频榜始终有两款国产模型稳居前五,月之暗面 kimi-k3-max 在智能体榜也进入 Top 5。国产大模型在多个维度持续缩小与海外顶级模型的差距,后续新品发布值得期待。

亲爱的凤凰网用户:

您当前使用的浏览器版本过低,导致网站不能正常访问,建议升级浏览器

第三方浏览器推荐:

谷歌(Chrome)浏览器 下载

360安全浏览器 下载