AI大模型周榜:国产GLM-5.3-Flash首秀杀进代码榜前十,千问3.8-Max登顶前端榜
IT之家 9 月 2 日消息,Arena(arena.ai)平台发布 2026 年第 35 周(8 月 24 日 ~8 月 30 日)AI 大模型盲测排行榜,本期有多款国产新模型亮相,且取得亮眼排名。
国产 GLM-5.3-Flash 首次进入代码榜 Top 10,Qwen3.8-Max-0902 首次入榜即登顶前端开发榜榜首,Kimi-K3-Max 稳定守住综合榜 Top 10 位置,整体来看国产模型在细分领域继续保持竞争力。
IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。
综合榜
本周综合榜头部格局稳定,Claude-Fable-5 以 1508 分蝉联榜首,Anthropic 多款模型占据前七位,排名变化均在 1 位以内,ELO 分差均在 30 分以内,属于统计误差范围内的接近。
另外,本周有两款新模型入榜,分别是谷歌 Gemini-3-Flash 和智谱 GLM-5.3-Flash,首秀分别排在第 27 位和第 30 位,ELO 分数分别为 1474 分和 1473 分。
国产模型整体处于中上游位置:
月之暗面 kimi-k3-max 排名最高,位列第 10 名,ELO 1489 分,排名持平;
智谱 glm-5.3-max 位列第 17 名,ELO 1482 分,较上周下降 4 位;
阿里 qwen3.8-max 位列第 20 名,ELO 1479 分,较上周下降 1 位;
阿里 qwen3.7-max-preview 位列第 28 名,ELO 1474 分,排名下降 1 位;
智谱 glm-5.3-flash 位列第 30 名,ELO 1473 分,为本周新入榜模型。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-fable-5 | Anthropic | 1508 ±5 | 27013 | $10 / $50 | 1M |
| 2 | - | claude-opus-4-6-high | Anthropic | 1505 ±4 | 72114 | $5 / $25 | 1M |
| 3 | - | claude-opus-4-7-high | Anthropic | 1502 ±4 | 60125 | $5 / $25 | 1M |
| 4 | - | muse-spark-1.2 (xHigh) | Meta | 1499 ±10 | 3245 | $1.25 / $4.25 | N/A |
| 5 | - | claude-opus-4-6 | Anthropic | 1498 ±3 | 76040 | $5 / $25 | 1M |
| 6 | - | claude-opus-4-7 | Anthropic | 1494 ±4 | 61248 | $5 / $25 | 1M |
| 7 | - | claude-opus-5-high | Anthropic | 1492 ±5 | 34718 | $5 / $25 | 1M |
| 8 | - | muse-spark-1.1 | Meta | 1491 ±5 | 23814 | $1.25 / $4.25 | N/A |
| 9 | - | gemini-3.7-flash-high | 1491 ±8 | 5682 | $0.75 / $3.57 | 1.05M | |
| 10 | - | kimi-k3-max | Moonshot | 1489 ±5 | 17908 | N/A | N/A |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 17 | ↓ 4 | glm-5.3-max | Z.ai | 1482 ±7 | 7454 | $1.4 / $4.4 | 1.05M |
| 20 | ↓ 1 | qwen3.8-max | Alibaba | 1479 ±6 | 13190 | $2 / $6 | 1M |
| 28 | ↓ 1 | qwen3.7-max-preview | Alibaba | 1474 ±10 | 3707 | $1.48 / $4.43 | 1M |
| 30 | 新上榜 | glm-5.3-flash | Z.ai | 1473 ±9 | 4451 | $0.15 / $0.5 | 1.05M |
代码榜
本周代码榜头部同样由 Anthropic 垄断,Claude-Opus-4-7-high 以 1552 分稳居第一,前三名 ELO 分差仅 1 分,在误差范围内视为并列。
最值得关注的是国产新模型 GLM-5.3-Flash 首次入榜即闯入 Top 10,排在第 7 名,ELO 分数达到 1535 分,超过绝大多数头部海外模型。另外 OpenAI 新模型 GPT-5.6-Terra-Xhigh 也首次入榜,排在第 30 名,ELO 1519 分。
国产模型在代码榜已有多款进入前列:
月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名持平;
智谱 glm-5.3-flash 位列第 7 名,ELO 1535 分,本周新入榜;
智谱 glm-5.3-max 位列第 16 名,ELO 1528 分,较上周下降 6 位;
阿里 qwen3.7-max-preview 位列第 18 名,ELO 1525 分,下降 1 位;
小米 mimo-v2.5-pro 位列第 24 名,ELO 1521 分,上升 3 位;
阿里 qwen3.8-max 位列第 29 名,ELO 1519 分,下降 4 位。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-opus-4-7-high | Anthropic | 1552 ±6 | 17190 | $5 / $25 | 1M |
| 2 | - | claude-opus-4-6-high | Anthropic | 1552 ±6 | 18804 | $5 / $25 | 1M |
| 3 | - | claude-fable-5 | Anthropic | 1551 ±8 | 7247 | $10 / $50 | 1M |
| 4 | - | claude-opus-4-7 | Anthropic | 1547 ±6 | 17347 | $5 / $25 | 1M |
| 5 | - | claude-opus-4-6 | Anthropic | 1546 ±5 | 21209 | $5 / $25 | 1M |
| 6 | - | kimi-k3-max | Moonshot | 1542 ±9 | 4674 | N/A | N/A |
| 7 | 新上榜 | glm-5.3-flash | Z.ai | 1535 ±18 | 1213 | $0.15 / $0.5 | 1.05M |
| 8 | - | claude-opus-4-8-high | Anthropic | 1534 ±6 | 13386 | $5 / $25 | 1M |
| 9 | - | muse-spark-1.2 (xHigh) | Meta | 1534 ±20 | 936 | $1.25 / $4.25 | N/A |
| 10 | ↓ 3 | claude-opus-5-high | Anthropic | 1533 ±7 | 9237 | $5 / $25 | 1M |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 16 | ↓ 6 | glm-5.3-max | Z.ai | 1528 ±14 | 1961 | $1.4 / $4.4 | 1.05M |
| 18 | ↓ 1 | qwen3.7-max-preview | Alibaba | 1525 ±18 | 1119 | $1.48 / $4.43 | 1M |
| 24 | ↑ 3 | mimo-v2.5-pro | Xiaomi | 1521 ±6 | 15762 | $0.44 / $0.87 | 1.05M |
| 29 | ↓ 4 | qwen3.8-max | Alibaba | 1519 ±10 | 3828 | $2 / $6 | 1M |
前端开发榜
本周前端开发榜迎来重大变化,阿里新模型 Qwen3.8-max-0902 首次入榜即直接登顶,以 1691 分夺得榜首,将此前的 Claude-Opus-5-Max 挤到第二。
腾讯新模型 Hy4-Preview 首秀排在第 8 名,ELO 1627 分;阿里 Qwen3.8-flash-next 首秀第 9 名( 1622 分),智谱 GLM-5.3-Flash 首秀第 12 名( 1604 分),四款国产新模型集体闯入前 12,表现极为抢眼。
国产模型在前端开发榜占据半壁江山,头部位置稳定:
阿里 qwen3.8-max-0902 位列第 1 名,ELO 1691 分,本周新入榜;
月之暗面 kimi-k3-max 位列第 3 名,ELO 1674 分,下降 1 位;
阿里 qwen3.8-max 位列第 4 名,ELO 1669 分,下降 1 位;
腾讯 hy4-preview 位列第 8 名,ELO 1627 分,本周新入榜;
阿里 qwen3.8-flash-next 位列第 9 名,ELO 1622 分,本周新入榜;
智谱 glm-5.3-flash 位列第 12 名,ELO 1604 分,本周新入榜。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | 新上榜 | qwen3.8-max-0902 | Alibaba | 1691 ±19 | 1390 | $2 / $6 | 1M |
| 2 | ↓ 1 | claude-opus-5-max | Anthropic | 1687 ±8 | 10517 | $5 / $25 | 1M |
| 3 | ↓ 1 | kimi-k3-max | Moonshot | 1674 ±11 | 4544 | $3 / $15 | 1.05M |
| 4 | ↓ 1 | qwen3.8-max | Alibaba | 1669 ±12 | 3220 | $2 / $6 | 1M |
| 5 | ↓ 1 | claude-opus-5-high | Anthropic | 1661 ±8 | 10462 | $5 / $25 | 1M |
| 6 | ↓ 1 | grok-4.6-high | SpaceXAI | 1629 ±17 | 1534 | $2 / $6 | 500K |
| 7 | ↓ 1 | claude-fable-5 | Anthropic | 1628 ±8 | 9131 | $10 / $50 | 1M |
| 8 | 新上榜 | hy4-preview | Tencent | 1627 ±17 | 1438 | $0.83 / $2.5 | 1.05M |
| 9 | 新上榜 | qwen3.8-flash-next | Alibaba | 1622 ±15 | 1939 | $0.16 / $0.47 | 1M |
| 10 | ↓ 3 | gpt-5.6-sol-xhigh (codex-harness) |
OpenAI | 1616 ±7 | 10766 | $4 / $20 | 1.05M |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 11 | ↓ 3 | glm-5.3-max | Z.ai | 1609 ±13 | 2712 | $1.4 / $4.4 | 1.05M |
| 12 | 新上榜 | glm-5.3-flash | Z.ai | 1604 ±16 | 1749 | $0.15 / $0.5 | 1.05M |
| 13 | ↓ 4 | qwen3.8-27b | Alibaba | 1598 ±11 | 3312 | $0.4 / $3 | N/A |
| 15 | ↓ 4 | glm-5.2-max | Z.ai | 1585 ±7 | 9636 | $1.4 / $4.4 | 1M |
| 16 | ↓ 4 | deepseek-v4-pro-high-20260813 | DeepSeek | 1583 ±11 | 3349 | $1.32 / $3.96 | N/A |
| 17 | ↓ 4 | deepseek-v4-flash-high | DeepSeek | 1580 ±10 | 3998 | $0.44 / $1.32 | 1.05M |
| 29 | ↓ 3 | seed-2.1-pro-preview | Bytedance | 1522 ±8 | 8452 | N/A | N/A |
智能体榜
本周智能体榜头部格局基本稳定,Anthropic 模型依然占据前三,Claude Opus 5 (High) 以 13.74% 的净提升度蝉联第一,工具幻觉率仅 0.8%,为头部模型中最低。值得关注的是智谱 GLM 5.2 (Max) 排名大幅提升 7 位,来到第 10 名,净提升度 6.23%,任务确认成功率达到 8.65%,表现亮眼。
本周共有四款新模型入榜,分别是 SpaceXAI Grok-4.6 (xHigh)、智谱 GLM 5.3 Flash、智谱 GLM 5.3 (Max)、阿里 Qwen3.8 Flash Next 和阿里 Qwen 3.8 27B,其中 Grok-4.6 (xHigh) 首秀排在第 15 名,净提升度 5.33%。
国产模型在智能体榜已有多款进入前 20,具体排名:
月之暗面 Kimi K3 (Max) 排名第 6 名,净提升度 8.71%,任务确认成功率 16.90%,较上周下降 2 位;
深度求索 DeepSeek V4 Pro (High) (0813) 排名第 14 名,净提升度 5.91%,任务确认成功率 13.14%;
阿里 Qwen3.8 Max 排名第 16 名,净提升度 5.24%,工具幻觉率仅 0.11%;
智谱 GLM 5.2 (Max) 排名第 10 名,净提升度 6.23%,较上周上升 7 位;
智谱 GLM 5.3 Flash 排名第 19 名,净提升度 4.03%,本周新入榜;
智谱 GLM 5.3 (Max) 排名第 20 名,净提升度 3.74%,本周新入榜。
| 排名 | 较上周 | 模型 | 厂商 | 净提升度 (±CI) | 任务确认成功率 | 好评 / 差评比 | 可控性 |
|---|---|---|---|---|---|---|---|
| 1 | - | Claude Opus 5 (High) | Anthropic | 13.74% ±1.8% | 14.96% ±3.73% | 21.82% ±6.81% | 16% ±3.26% |
| 2 | - | Claude Opus 5 (Max) | Anthropic | 11.69% ±2.01% | 15.49% ±4.03% | 18.35% ±7.36% | 8.3% ±3.98% |
| 3 | - | Claude Fable 5 (High) | Anthropic | 10.61% ±1.53% | 6.81% ±3.3% | 20.25% ±5.49% | 13.23% ±2.77% |
| 4 | ↑ 1 | GPT 5.6 Sol (xHigh) | OpenAI | 9.49% ±1.51% | 7.57% ±3.2% | 21.62% ±5.62% | 8.73% ±2.88% |
| 5 | ↑ 1 | Claude Opus 4.8 (High) | Anthropic | 9.22% ±1.53% | 5.38% ±3.11% | 18.87% ±5.3% | 12.06% ±2.83% |
| 6 | ↓ 2 | Kimi K3 (Max) | Moonshot | 8.71% ±0.66% | 16.9% ±1.35% | 15.85% ±2.31% | 2.13% ±1.29% |
| 7 | - | GPT 5.5 (xHigh) | OpenAI | 7.53% ±1.08% | 2.45% ±2.36% | 12.23% ±3.75% | 8.55% ±1.99% |
| 8 | ↑ 3 | Claude Sonnet 5 (High) | Anthropic | 7.51% ±2.11% | 1.07% ±4.44% | 12.46% ±7.28% | 12.29% ±4.43% |
| 9 | ↓ 1 | Claude Opus 4.7 (High) | Anthropic | 6.49% ±1.42% | 3.98% ±3% | 10.47% ±4.7% | 6.18% ±2.62% |
| 10 | ↑ 7 | GLM 5.2 (Max) | Z.ai | 6.23% ±0.77% | 8.65% ±1.66% | 11.26% ±2.71% | 5.41% ±1.41% |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 14 | - | DeepSeek V4 Pro (High) (0813) | DeepSeek | 5.91% ±1.04% | 13.14% ±2.13% | 5.47% ±3.51% | 1.06% ±2.31% |
| 16 | ↓ 1 | Qwen3.8 Max | Alibaba | 5.24% ±1.13% | 8.38% ±2.5% | 6.47% ±3.89% | 4.56% ±2.26% |
| 19 | 新上榜 | GLM 5.3 Flash | Z.ai | 4.03% ±1.23% | 14.56% ±2.63% | 4.64% ±4.09% | 1.19% ±2.7% |
| 20 | 新上榜 | GLM 5.3 (Max) | Z.ai | 3.74% ±0.77% | 12.36% ±1.71% | 4.27% ±2.53% | 0.83% ±1.55% |
| 23 | ↓ 3 | Deepseek V4 Flash (High) (20260731) |
DeepSeek | 2.85% ±0.81% | 6.97% ±1.82% | 3.38% ±2.73% | 0.16% ±1.65% |
| 24 | 新上榜 | Qwen3.8 Flash Next | Alibaba | 2.51% ±1.57% | 11.86% ±3.26% | 1.54% ±5.29% | 0.31% ±3.72% |
| 27 | - | Kimi K2.7 Code | Moonshot | 1.24% ±2.52% | 1.92% ±5.57% | 1.16% ±8.58% | 5.13% ±5.51% |
| 28 | 新上榜 | Qwen 3.8 27B | Alibaba | 1.19% ±1.11% | 7.08% ±2.54% | 0.84% ±3.67% | 0.27% ±2.28% |
AI 生图榜
本周 AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1382 分继续领跑,国产 seedream-5.0-pro 稳居第 8 名,qwen-image-3.0-pro 排在第 9 名,两款国产模型均守住 Top 10 位置。谷歌 gemini-2.5-flash-image-preview 本周新入榜,排在第 30 名,ELO 1150 分。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | gpt-image-2 (medium) | OpenAI | 1382 ±4 | 75014 | $8 / $30 | N/A |
| 2 | - | mai-image-2.6-preview | Microsoft AI | 1331 ±8 | 6418 | N/A | N/A |
| 3 | - | grok-imagine-image-2.0 (low) | SpaceXAI | 1316 ±12 | 2675 | N/A | N/A |
| 4 | - | reve-2.1 | Reve | 1302 ±8 | 7580 | N/A | N/A |
| 5 | - | muse-image | Meta | 1281 ±6 | 22691 | N/A | N/A |
| 6 | - | reve-2.0 | Reve | 1270 ±6 | 14631 | N/A | N/A |
| 7 | - | gemini-3.1-flash-image (nano-banana-2) [web-search] |
1263 ±5 | 36392 | $0.5 / $3 | 131.1K | |
| 8 | - | seedream-5.0-pro | Bytedance | 1258 ±5 | 48174 | N/A | N/A |
| 9 | - | qwen-image-3.0-pro | Alibaba | 1255 ±7 | 10927 | N/A | N/A |
| 10 | - | mai-image-2.5 | Microsoft AI | 1254 ±4 | 56737 | N/A | N/A |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 16 | - | qwen-image-2.0-pro-2026-06-22 | Alibaba | 1191 ±6 | 12013 | N/A | N/A |
| 29 | - | hunyuan-image-3.0 | Tencent | 1151 ±3 | 173101 | N/A | N/A |
AI 视频榜
本周 AI 视频榜迎来新榜首,谷歌 gemini-omni-1.1-flash 首次入榜即夺得第一,ELO 1515 分,超过此前的 gemini-omni-flash。
国产模型方面,dreamina-seedance-2.0-720p 排在第 4 名,dreamina-seedance-2.5-720p 排在第 5 名,minimax-h3 上升至第 6 名,MiniMax 新模型 hailuo-2.3 首次入榜排在第 30 名,ELO 1205 分。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | 新上榜 | gemini-omni-1.1-flash | 1515 ±16 | 1762 | $1.5 / $9 | 131.1K | |
| 2 | ↓ 1 | gemini-omni-flash | 1512 ±10 | 19830 | N/A | N/A | |
| 3 | ↓ 1 | flux-3-video | Black Forest Labs | 1495 ±17 | 1287 | N/A | N/A |
| 4 | ↓ 1 | dreamina-seedance-2.0-720p | Bytedance | 1479 ±9 | 51266 | N/A | N/A |
| 5 | ↓ 1 | dreamina-seedance-2.5-720p | Bytedance | 1476 ±14 | 2121 | N/A | N/A |
| 6 | - | minimax-h3 | MiniMax | 1460 ±10 | 5813 | N/A | N/A |
| 7 | ↓ 2 | muse-video | Meta | 1457 ±15 | 2178 | N/A | N/A |
| 8 | ↓ 1 | happyhorse-1.0 | Alibaba-ATH | 1428 ±13 | 22112 | N/A | N/A |
| 9 | ↓ 1 | sora-2-pro | OpenAI | 1365 ±7 | 48782 | $0 / $0.3 | N/A |
| 10 | ↓ 1 | veo-3.1-audio | 1364 ±14 | 13705 | $0 / $0.4 | N/A | |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 15 | - | wan2.7-t2v | Alibaba | 1344 ±8 | 20882 | N/A | N/A |
| 19 | ↓ 1 | wan2.6-t2v | Alibaba | 1329 ±8 | 47267 | N/A | N/A |
| 20 | ↓ 1 | seedance-v1.5-pro | Bytedance | 1256 ±7 | 75890 | N/A | N/A |
| 23 | ↓ 2 | wan2.5-t2v-preview | Alibaba | 1247 ±9 | 30497 | N/A | N/A |
| 30 | 新上榜 | hailuo-2.3 | MiniMax | 1205 ±6 | 79981 | N/A | N/A |
总结来看,本周 Arena 周榜最大看点是多款国产新模型集中亮相并取得优异排名,glm-5.3-flash 在代码榜闯入 Top 10,qwen3.8-max-0902 更是直接登顶前端开发榜,显示国产模型在代码开发领域持续进步。头部依然是 Anthropic 模型垄断综合和代码榜,但国产模型在细分领域已经能冲击榜首位置,后续更多国产新模型的表现值得继续关注。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”




