文本榜单
本页展示 Arena AI 榜单前 30 名的每日快照,方便快速了解近期模型表现。完整榜单、筛选项和最新变化请到 Arena AI 官网查看。
本榜单是 Arena AI 最核心的文本对战榜单,根据人类盲投对战估算模型相对实力。
数据更新时间: 2026-09-19 12:14:58 UTC / 2026-09-19 20:14:58 CST (北京时间)
前 30 名
| 排名 | 排名区间 | 模型 | 分数 | 票数 | 价格 $/百万Token | 上下文 |
|---|---|---|---|---|---|---|
| 1 | 1-7 | claude-fable-5-high 1 | 1506 (±5) | 30,057 | $10 / $50 | 1M |
| 2 | 1-7 | claude-opus-4-6-high 1 | 1505 (±4) | 71,993 | $5 / $25 | 1M |
| 3 | 1-10 | claude-opus-4-7-high 1 | 1502 (±4) | 60,002 | $5 / $25 | 1M |
| 4 | 1-19 | muse-spark-1.2 (xHigh) 1 | 1500 (±11) | 3,227 | $1.25 / $4.25 | N/A |
| 5 | 1-15 | claude-fable-5.1-max 1 | 1498 (±8) | 5,783 | $10 / $50 | 1M |
| 6 | 3-12 | claude-opus-4-6 1 | 1497 (±3) | 75,878 | $5 / $25 | 1M |
| 7 | 3-15 | claude-opus-4-7 1 | 1494 (±4) | 61,128 | $5 / $25 | 1M |
| 8 | 1-24 | muse-spark-1.3-max 1 | 1493 (±9) | 4,723 | N/A | N/A |
| 9 | 1-24 | gemini-3.8-flash-high 1 | 1493 (±9) Preliminary | 5,076 | $0.75 / $3.75 | 1M |
| 10 | 4-19 | claude-opus-5-high 1 | 1493 (±4) | 42,617 | $5 / $25 | 1M |
| 11 | 4-20 | muse-spark-1.1 1 | 1493 (±5) | 27,615 | $1.25 / $4.25 | N/A |
| 12 | 3-27 | gemini-3.7-flash-high 1 | 1490 (±8) Preliminary | 5,640 | $0.75 / $3.75 | 1M |
| 13 | 5-25 | muse-spark 1 | 1488 (±6) | 13,565 | N/A | N/A |
| 14 | 5-27 | claude-opus-5-max 1 | 1487 (±5) | 20,706 | $5 / $25 | 1M |
| 15 | 7-24 | gemini-3.1-pro-preview 1 | 1487 (±3) | 106,951 | $1 / $6 | 1M |
| 16 | 7-27 | gemini-3-pro 1 | 1485 (±4) | 40,654 | $2 / $12 | 1M |
| 17 | 7-30 | kimi-k3-max 1 | 1485 (±5) | 20,987 | N/A | N/A |
| 18 | 9-32 | gpt-5.6-sol-xhigh 1 | 1483 (±5) | 27,069 | $4 / $20 | N/A |
| 19 | 7-37 | glm-5.3-max 1 | 1483 (±6) | 10,960 | $1.40 / $4.40 | 1M |
| 20 | 10-34 | gpt-5.5-high 1 | 1482 (±4) | 64,924 | $5 / $30 | 1.1M |
| 21 | 10-35 | claude-opus-4-8-high 1 | 1481 (±4) | 52,535 | $5 / $25 | 1M |
| 22 | 10-39 | qwen3.8-max 1 | 1481 (±6) | 16,670 | $2 / $6 | 1M |
| 23 | 10-39 | gemini-3.6-flash-high 1 | 1480 (±5) | 26,445 | $0.75 / $3.75 | 1M |
| 24 | 5-51 | gpt-6-astra-max 1 | 1480 (±12) | 2,693 | N/A | N/A |
| 25 | 14-40 | gemini-3.5-flash-high 1 | 1478 (±4) | 38,257 | $0.75 / $4.50 | 1M |
| 26 | 17-43 | gpt-5.4-high 1 | 1476 (±4) | 60,537 | $2.50 / $15 | 1.1M |
| 27 | 17-43 | gpt-5.2-chat-latest-20260210 1 | 1476 (±4) | 34,176 | $1.75 / $14 | 128K |
| 28 | 17-43 | gpt-5.5 1 | 1476 (±4) | 66,317 | $5 / $30 | 1.1M |
| 29 | 14-49 | glm-5.3-flash 1 | 1475 (±7) | 10,038 | $0.07 / $0.25 | 1M |
| 30 | 18-47 | grok-4.20-beta1 1 | 1475 (±5) | 26,599 | N/A | N/A |
怎么看这张表
- 排名 / 排名区间:Arena AI 根据对战投票估算的相对名次;排名区间表示在置信范围内的名次波动。
- 分数:相对评分,适合比较同一时刻榜单中的模型。
- 票数 / 会话数:样本量参考;样本较少时,排名通常更容易波动。
- 价格 $/百万Token:输入 / 输出每百万 Token 的参考价格。
- 上下文:模型支持的最大上下文长度。
选模型时再确认三件事
- Provider 是否实际提供这个模型,以及你的地区和账户是否可用;
- API 价格、速率限制和上下文是否适合你的任务;
- 用 3~5 个真实任务做小规模测试,不要只看总榜名次。
数据来源
数据来自 Arena AI 官方 文本榜单,由 GitHub Actions 每天更新。模型价格、许可证和能力请以模型服务商官方信息为准。
