Cherry Studio
文档

文本榜单

本页展示 Arena AI 榜单前 30 名的每日快照,方便快速了解近期模型表现。完整榜单、筛选项和最新变化请到 Arena AI 官网查看。

本榜单是 Arena AI 最核心的文本对战榜单,根据人类盲投对战估算模型相对实力。

数据更新时间: 2026-09-19 12:14:58 UTC / 2026-09-19 20:14:58 CST (北京时间)

前 30 名

排名排名区间模型分数票数价格 $/百万Token上下文
11-7claude-fable-5-high 11506 (±5)30,057$10 / $501M
21-7claude-opus-4-6-high 11505 (±4)71,993$5 / $251M
31-10claude-opus-4-7-high 11502 (±4)60,002$5 / $251M
41-19muse-spark-1.2 (xHigh) 11500 (±11)3,227$1.25 / $4.25N/A
51-15claude-fable-5.1-max 11498 (±8)5,783$10 / $501M
63-12claude-opus-4-6 11497 (±3)75,878$5 / $251M
73-15claude-opus-4-7 11494 (±4)61,128$5 / $251M
81-24muse-spark-1.3-max 11493 (±9)4,723N/AN/A
91-24gemini-3.8-flash-high 11493 (±9) Preliminary5,076$0.75 / $3.751M
104-19claude-opus-5-high 11493 (±4)42,617$5 / $251M
114-20muse-spark-1.1 11493 (±5)27,615$1.25 / $4.25N/A
123-27gemini-3.7-flash-high 11490 (±8) Preliminary5,640$0.75 / $3.751M
135-25muse-spark 11488 (±6)13,565N/AN/A
145-27claude-opus-5-max 11487 (±5)20,706$5 / $251M
157-24gemini-3.1-pro-preview 11487 (±3)106,951$1 / $61M
167-27gemini-3-pro 11485 (±4)40,654$2 / $121M
177-30kimi-k3-max 11485 (±5)20,987N/AN/A
189-32gpt-5.6-sol-xhigh 11483 (±5)27,069$4 / $20N/A
197-37glm-5.3-max 11483 (±6)10,960$1.40 / $4.401M
2010-34gpt-5.5-high 11482 (±4)64,924$5 / $301.1M
2110-35claude-opus-4-8-high 11481 (±4)52,535$5 / $251M
2210-39qwen3.8-max 11481 (±6)16,670$2 / $61M
2310-39gemini-3.6-flash-high 11480 (±5)26,445$0.75 / $3.751M
245-51gpt-6-astra-max 11480 (±12)2,693N/AN/A
2514-40gemini-3.5-flash-high 11478 (±4)38,257$0.75 / $4.501M
2617-43gpt-5.4-high 11476 (±4)60,537$2.50 / $151.1M
2717-43gpt-5.2-chat-latest-20260210 11476 (±4)34,176$1.75 / $14128K
2817-43gpt-5.5 11476 (±4)66,317$5 / $301.1M
2914-49glm-5.3-flash 11475 (±7)10,038$0.07 / $0.251M
3018-47grok-4.20-beta1 11475 (±5)26,599N/AN/A

怎么看这张表

  • 排名 / 排名区间:Arena AI 根据对战投票估算的相对名次;排名区间表示在置信范围内的名次波动。
  • 分数:相对评分,适合比较同一时刻榜单中的模型。
  • 票数 / 会话数:样本量参考;样本较少时,排名通常更容易波动。
  • 价格 $/百万Token:输入 / 输出每百万 Token 的参考价格。
  • 上下文:模型支持的最大上下文长度。

选模型时再确认三件事

  1. Provider 是否实际提供这个模型,以及你的地区和账户是否可用;
  2. API 价格、速率限制和上下文是否适合你的任务;
  3. 用 3~5 个真实任务做小规模测试,不要只看总榜名次。

数据来源

数据来自 Arena AI 官方 文本榜单,由 GitHub Actions 每天更新。模型价格、许可证和能力请以模型服务商官方信息为准。

本页内容