Agent 智能体榜单
本页展示 Arena AI 榜单前 30 名的每日快照,方便快速了解近期模型表现。完整榜单、筛选项和最新变化请到 Arena AI 官网查看。
本榜单评测模型在多轮工具调用 / 智能体任务上的综合表现,涵盖净改进率、确认成功率、赞踩比、可控性、Bash 恢复率、工具幻觉率等维度。
数据更新时间: 2026-09-19 12:14:58 UTC / 2026-09-19 20:14:58 CST (北京时间)
前 30 名
| 排名 | 排名区间 | 模型 | 净改进率 | 确认成功率 | 赞踩比 | 可控性 | Bash 恢复率 | 工具幻觉率 | 会话数 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 1-2 | Claude Fable 5.1 (Max) 1 | 13.71%±1.72% | 19.83%±2.75% | 31.83%±6.86% | 3.88%±3.61% | 12.62%±0.76% | 0.37%±0.03% | 13,320 |
| 2 | 1-6 | GPT 6 Astra (Max) 1 | 11.54%±2.10% | 17.70%±3.26% | 32.79%±8.37% | 0.47%±4.67% | 7.28%±1.11% | 0.37%±0.03% | 10,372 |
| 3 | 2-6 | Claude Opus 5 (High) 1 | 10.25%±1.41% | 9.24%±2.94% | 18.66%±5.22% | 11.04%±2.75% | 11.98%±0.77% | 0.33%±0.04% | 24,794 |
| 4 | 2-6 | Claude Opus 5 (Max) 1 | 10.16%±1.55% | 12.41%±3.04% | 18.15%±5.77% | 6.83%±3.05% | 13.08%±0.77% | 0.35%±0.04% | 19,934 |
| 5 | 2-8 | Claude Fable 5 (High) 1 | 8.81%±1.25% | 5.97%±2.66% | 18.07%±4.46% | 10.60%±2.28% | 9.06%±1.28% | 0.37%±0.03% | 38,293 |
| 6 | 2-8 | Claude Opus 4.8 (High) 1 | 8.19%±1.27% | 6.28%±2.47% | 16.23%±4.59% | 11.06%±2.22% | 7.49%±1.51% | 0.12%±0.31% | 39,731 |
| 7 | 5-13 | GPT 5.6 Sol (xHigh) 1 | 7.10%±1.28% | 3.74%±2.61% | 20.48%±4.62% | 6.62%±2.41% | 4.30%±0.93% | 0.37%±0.03% | 32,207 |
| 8 | 7-13 | Kimi K3 (Max) 1 | 6.22%±0.62% | 11.91%±1.28% | 11.79%±2.18% | 1.99%±1.28% | 5.03%±0.52% | 0.37%±0.03% | 108,615 |
| 9 | 5-16 | Claude Sonnet 5 (High) 1 | 5.97%±1.62% | 2.88%±3.34% | 11.03%±5.77% | 8.39%±3.38% | 7.36%±1.06% | 0.18%±0.10% | 30,631 |
| 10 | 7-17 | GPT 5.5 (xHigh) 1 | 5.03%±0.92% | 0.61%±2.02% | 9.14%±3.18% | 6.61%±1.77% | 9.63%±1.25% | 0.37%±0.03% | 53,054 |
| 11 | 7-17 | Hy4 preview 1 | 5.01%±1.02% | 9.85%±1.98% | 8.76%±3.77% | 1.23%±2.16% | 7.44%±0.56% | 0.23%±0.06% | 38,074 |
| 12 | 7-19 | Deepseek V4.1 Flash (Max) 1 | 4.88%±1.33% | 13.35%±2.49% | 4.76%±4.56% | 1.63%±3.40% | 7.63%±0.71% | 0.29%±0.05% | 20,080 |
| 13 | 7-21 | Gemini 3.8 Flash (High) 1 | 4.71%±1.91% | 9.30%±3.70% | 13.34%±6.70% | 1.22%±4.83% | 1.91%±1.59% | 0.22%±0.19% | 12,534 |
| 14 | 9-18 | GLM 5.2 (Max) 1 | 4.37%±0.69% | 4.90%±1.50% | 9.76%±2.42% | 4.88%±1.31% | 1.93%±0.73% | 0.37%±0.03% | 76,766 |
| 15 | 9-20 | Muse Spark 1.3 (Max) 1 | 4.20%±0.86% | 10.31%±1.71% | 2.94%±2.94% | 1.47%±1.94% | 5.91%±0.77% | 0.37%±0.03% | 31,052 |
| 16 | 9-20 | DeepSeek V4 Pro (High) (0813) 1 | 4.14%±0.79% | 6.81%±1.64% | 5.94%±2.80% | 1.37%±1.64% | 6.22%±0.59% | 0.36%±0.04% | 47,602 |
| 17 | 10-23 | Qwen3.8 Max 1 | 3.30%±0.84% | 5.83%±1.82% | 4.20%±2.87% | 3.63%±1.75% | 4.11%±0.81% | 1.25%±0.38% | 31,489 |
| 18 | 13-23 | GLM 5.3 (Max) 1 | 3.05%±0.62% | 8.48%±1.36% | 5.54%±2.12% | 1.86%±1.18% | 0.99%±0.58% | 0.37%±0.03% | 73,287 |
| 19 | 12-24 | Grok 4.5 1 | 2.92%±0.99% | 1.88%±2.27% | 0.10%±3.33% | 5.86%±2.02% | 6.59%±1.22% | 0.37%±0.03% | 38,146 |
| 20 | 14-24 | GPT 5.5 1 | 2.67%±0.81% | 2.01%±1.77% | 5.42%±2.73% | 3.20%±1.48% | 6.36%±1.19% | 0.37%±0.03% | 81,254 |
| 21 | 16-25 | Grok 4.6 (xHigh) 1 | 2.01%±1.05% | 2.55%±2.53% | 0.88%±3.38% | 4.74%±2.13% | 6.59%±0.91% | 0.37%±0.03% | 22,548 |
| 22 | 17-25 | Deepseek V4 Flash (High) (20260731) 1 | 1.80%±0.73% | 3.25%±1.61% | 3.54%±2.53% | 0.41%±1.50% | 1.45%±0.60% | 0.34%±0.04% | 64,482 |
| 23 | 17-27 | GPT 5.6 Terra (xHigh) 1 | 1.44%±1.11% | 4.44%±2.54% | 3.28%±3.74% | 4.93%±2.18% | 3.05%±1.38% | 0.37%±0.03% | 20,301 |
| 24 | 19-26 | GPT 5.4 (High) 1 | 1.26%±0.80% | 1.63%±1.83% | 0.41%±2.71% | 2.55%±1.59% | 4.62%±1.01% | 0.37%±0.03% | 80,406 |
| 25 | 21-26 | GLM 5.3 Flash 1 | 1.15%±0.67% | 8.24%±1.47% | 1.61%±2.18% | 0.15%±1.40% | 4.63%±0.69% | 0.37%±0.03% | 43,164 |
| 26 | 23-31 | Qwen3.8 Flash Next 1 | 0.07%±0.76% | 8.92%±1.54% | 1.73%±2.61% | 4.70%±1.73% | 2.00%±0.48% | 0.87%±0.10% | 57,458 |
| 27 | 25-32 | GPT 5.6 Luna (xHigh) 1 | 0.44%±0.84% | 4.99%±1.99% | 3.39%±2.64% | 2.12%±1.78% | 3.70%±0.99% | 0.37%±0.03% | 29,186 |
| 28 | 26-32 | Gemini 3.7 Flash (High) 1 | 0.60%±0.65% | 2.88%±1.57% | 3.52%±2.03% | 0.28%±1.34% | 2.08%±0.70% | 0.03%±0.30% | 48,195 |
| 29 | 26-32 | Qwen 3.8 27B 1 | 0.64%±0.72% | 4.31%±1.65% | 2.11%±2.36% | 0.08%±1.56% | 5.20%±0.69% | 0.30%±0.15% | 37,257 |
| 30 | 26-32 | DeepSeek V4 Pro 1 | 0.71%±0.93% | 1.71%±2.22% | 2.74%±3.16% | 2.13%±1.79% | 3.16%±0.85% | 0.15%±0.11% | 35,465 |
怎么看这张表
- 排名 / 排名区间:Arena AI 根据智能体任务对战投票估算的相对名次;排名区间表示在置信范围内的名次波动。
- 净改进率:相比基线在多轮工具调用 / 智能体任务中的净改进幅度。
- 确认成功率:任务完成后用户确认成功(赞)的比例。
- 赞踩比:用户对回答投“赞”与“踩”的比例,反映主观满意度。
- 可控性:模型遵循指令并保持稳定输出的能力。
- Bash 恢复率:在 Bash / 命令行操作出错后能自我恢复的比例。
- 工具幻觉率:模型虚构或调用不存在工具的比例,越低越好。
- 会话数:样本量参考;样本较少时,排名通常更容易波动。
选模型时再确认三件事
- Provider 是否实际提供这个模型,以及你的地区和账户是否可用;
- API 价格、速率限制和上下文是否适合你的任务;
- 用 3~5 个真实任务做小规模测试,不要只看总榜名次。
数据来源
数据来自 Arena AI 官方 Agent 智能体榜单,由 GitHub Actions 每天更新。模型价格、许可证和能力请以模型服务商官方信息为准。
