Cherry Studio
文档

Agent 智能体榜单

本页展示 Arena AI 榜单前 30 名的每日快照,方便快速了解近期模型表现。完整榜单、筛选项和最新变化请到 Arena AI 官网查看。

本榜单评测模型在多轮工具调用 / 智能体任务上的综合表现,涵盖净改进率、确认成功率、赞踩比、可控性、Bash 恢复率、工具幻觉率等维度。

数据更新时间: 2026-09-19 12:14:58 UTC / 2026-09-19 20:14:58 CST (北京时间)

前 30 名

排名排名区间模型净改进率确认成功率赞踩比可控性Bash 恢复率工具幻觉率会话数
11-2Claude Fable 5.1 (Max) 113.71%±1.72%19.83%±2.75%31.83%±6.86%3.88%±3.61%12.62%±0.76%0.37%±0.03%13,320
21-6GPT 6 Astra (Max) 111.54%±2.10%17.70%±3.26%32.79%±8.37%0.47%±4.67%7.28%±1.11%0.37%±0.03%10,372
32-6Claude Opus 5 (High) 110.25%±1.41%9.24%±2.94%18.66%±5.22%11.04%±2.75%11.98%±0.77%0.33%±0.04%24,794
42-6Claude Opus 5 (Max) 110.16%±1.55%12.41%±3.04%18.15%±5.77%6.83%±3.05%13.08%±0.77%0.35%±0.04%19,934
52-8Claude Fable 5 (High) 18.81%±1.25%5.97%±2.66%18.07%±4.46%10.60%±2.28%9.06%±1.28%0.37%±0.03%38,293
62-8Claude Opus 4.8 (High) 18.19%±1.27%6.28%±2.47%16.23%±4.59%11.06%±2.22%7.49%±1.51%0.12%±0.31%39,731
75-13GPT 5.6 Sol (xHigh) 17.10%±1.28%3.74%±2.61%20.48%±4.62%6.62%±2.41%4.30%±0.93%0.37%±0.03%32,207
87-13Kimi K3 (Max) 16.22%±0.62%11.91%±1.28%11.79%±2.18%1.99%±1.28%5.03%±0.52%0.37%±0.03%108,615
95-16Claude Sonnet 5 (High) 15.97%±1.62%2.88%±3.34%11.03%±5.77%8.39%±3.38%7.36%±1.06%0.18%±0.10%30,631
107-17GPT 5.5 (xHigh) 15.03%±0.92%0.61%±2.02%9.14%±3.18%6.61%±1.77%9.63%±1.25%0.37%±0.03%53,054
117-17Hy4 preview 15.01%±1.02%9.85%±1.98%8.76%±3.77%1.23%±2.16%7.44%±0.56%0.23%±0.06%38,074
127-19Deepseek V4.1 Flash (Max) 14.88%±1.33%13.35%±2.49%4.76%±4.56%1.63%±3.40%7.63%±0.71%0.29%±0.05%20,080
137-21Gemini 3.8 Flash (High) 14.71%±1.91%9.30%±3.70%13.34%±6.70%1.22%±4.83%1.91%±1.59%0.22%±0.19%12,534
149-18GLM 5.2 (Max) 14.37%±0.69%4.90%±1.50%9.76%±2.42%4.88%±1.31%1.93%±0.73%0.37%±0.03%76,766
159-20Muse Spark 1.3 (Max) 14.20%±0.86%10.31%±1.71%2.94%±2.94%1.47%±1.94%5.91%±0.77%0.37%±0.03%31,052
169-20DeepSeek V4 Pro (High) (0813) 14.14%±0.79%6.81%±1.64%5.94%±2.80%1.37%±1.64%6.22%±0.59%0.36%±0.04%47,602
1710-23Qwen3.8 Max 13.30%±0.84%5.83%±1.82%4.20%±2.87%3.63%±1.75%4.11%±0.81%1.25%±0.38%31,489
1813-23GLM 5.3 (Max) 13.05%±0.62%8.48%±1.36%5.54%±2.12%1.86%±1.18%0.99%±0.58%0.37%±0.03%73,287
1912-24Grok 4.5 12.92%±0.99%1.88%±2.27%0.10%±3.33%5.86%±2.02%6.59%±1.22%0.37%±0.03%38,146
2014-24GPT 5.5 12.67%±0.81%2.01%±1.77%5.42%±2.73%3.20%±1.48%6.36%±1.19%0.37%±0.03%81,254
2116-25Grok 4.6 (xHigh) 12.01%±1.05%2.55%±2.53%0.88%±3.38%4.74%±2.13%6.59%±0.91%0.37%±0.03%22,548
2217-25Deepseek V4 Flash (High) (20260731) 11.80%±0.73%3.25%±1.61%3.54%±2.53%0.41%±1.50%1.45%±0.60%0.34%±0.04%64,482
2317-27GPT 5.6 Terra (xHigh) 11.44%±1.11%4.44%±2.54%3.28%±3.74%4.93%±2.18%3.05%±1.38%0.37%±0.03%20,301
2419-26GPT 5.4 (High) 11.26%±0.80%1.63%±1.83%0.41%±2.71%2.55%±1.59%4.62%±1.01%0.37%±0.03%80,406
2521-26GLM 5.3 Flash 11.15%±0.67%8.24%±1.47%1.61%±2.18%0.15%±1.40%4.63%±0.69%0.37%±0.03%43,164
2623-31Qwen3.8 Flash Next 10.07%±0.76%8.92%±1.54%1.73%±2.61%4.70%±1.73%2.00%±0.48%0.87%±0.10%57,458
2725-32GPT 5.6 Luna (xHigh) 10.44%±0.84%4.99%±1.99%3.39%±2.64%2.12%±1.78%3.70%±0.99%0.37%±0.03%29,186
2826-32Gemini 3.7 Flash (High) 10.60%±0.65%2.88%±1.57%3.52%±2.03%0.28%±1.34%2.08%±0.70%0.03%±0.30%48,195
2926-32Qwen 3.8 27B 10.64%±0.72%4.31%±1.65%2.11%±2.36%0.08%±1.56%5.20%±0.69%0.30%±0.15%37,257
3026-32DeepSeek V4 Pro 10.71%±0.93%1.71%±2.22%2.74%±3.16%2.13%±1.79%3.16%±0.85%0.15%±0.11%35,465

怎么看这张表

  • 排名 / 排名区间:Arena AI 根据智能体任务对战投票估算的相对名次;排名区间表示在置信范围内的名次波动。
  • 净改进率:相比基线在多轮工具调用 / 智能体任务中的净改进幅度。
  • 确认成功率:任务完成后用户确认成功(赞)的比例。
  • 赞踩比:用户对回答投“赞”与“踩”的比例,反映主观满意度。
  • 可控性:模型遵循指令并保持稳定输出的能力。
  • Bash 恢复率:在 Bash / 命令行操作出错后能自我恢复的比例。
  • 工具幻觉率:模型虚构或调用不存在工具的比例,越低越好。
  • 会话数:样本量参考;样本较少时,排名通常更容易波动。

选模型时再确认三件事

  1. Provider 是否实际提供这个模型,以及你的地区和账户是否可用;
  2. API 价格、速率限制和上下文是否适合你的任务;
  3. 用 3~5 个真实任务做小规模测试,不要只看总榜名次。

数据来源

数据来自 Arena AI 官方 Agent 智能体榜单,由 GitHub Actions 每天更新。模型价格、许可证和能力请以模型服务商官方信息为准。

本页内容