Cherry Studio
文档

搜索榜单

本页展示 Arena AI 榜单前 30 名的每日快照,方便快速了解近期模型表现。完整榜单、筛选项和最新变化请到 Arena AI 官网查看。

本榜单评测模型在联网搜索 / 信息检索类任务上的表现。

数据更新时间: 2026-09-19 12:14:58 UTC / 2026-09-19 20:14:58 CST (北京时间)

前 30 名

排名排名区间模型分数票数价格 $/百万Token上下文
11-2gpt-5.6-sol-xhigh 11257 (±7)29,663$4/$201.1M
21-2claude-opus-4-6-search 11253 (±5)134,699$5/$251M
33-5gpt-5.5-search 11242 (±5)89,873$5/$301.1M
43-6claude-opus-4-7 11233 (±5)91,394$5/$251M
53-7claude-fable-5-high 11230 (±8)41,795$10/$501M
64-8ernie-5.1 11227 (±10)3,788$0.56/$2.54119K
75-8claude-sonnet-4-6-search 11221 (±5)134,905$1.50/$7.501M
86-13grok-4.5 11213 (±7)31,505$2/$6500K
98-13gemini-3.1-pro-grounding 11210 (±5)113,282N/AN/A
108-16gemini-3-pro-grounding 11207 (±6)37,024$2/$12N/A
118-16gpt-5.2-search 11207 (±6)52,712$0.88/$7400K
128-17claude-opus-4-8 11204 (±6)70,998$5/$251M
138-17grok-4.20-multi-agent-beta-0309 11204 (±5)109,553$1.25/$2.501M
1410-18gpt-5.1-search 11199 (±5)59,909$0.63/$5400K
1510-18gemini-3-flash-grounding 11198 (±5)149,334N/AN/A
1610-18gpt-5.4-search 11197 (±5)110,116$2.50/$151.1M
1712-18claude-sonnet-5-search 11194 (±7)40,230$2/$101M
1814-19grok-4.20-beta1 11189 (±6)53,921N/AN/A
1918-22claude-opus-4-5-search 11180 (±6)61,573$5/$25200K
2019-23gpt-5.2-search-non-reasoning 11172 (±6)75,658$0.88/$7400K
2119-23grok-4-1-fast-search 11171 (±5)81,507$1.25/$2.502M
2219-23grok-4-fast-search 11171 (±5)41,794$0.20/$0.502M
2320-24grok-4.3 11165 (±5)91,483$1.25/$2.501M
2423-24claude-sonnet-4-5-search 11158 (±5)127,378$3/$151M
2525-29claude-opus-4-1-search 11148 (±5)76,933$15/$75200K
2625-29o3-search 11144 (±5)20,644$1/$4200K
2725-30gemini-2.5-pro-grounding 11142 (±5)83,404$0.63/$51M
2825-31grok-4-search 11142 (±6)19,108$3/$15N/A
2925-31ppl-sonar-reasoning-pro-high 11139 (±6)29,055$1/$1127.1K
3027-32gpt-5-search 11133 (±6)20,781$0.63/$5400K

怎么看这张表

  • 排名 / 排名区间:Arena AI 根据对战投票估算的相对名次;排名区间表示在置信范围内的名次波动。
  • 分数:相对评分,适合比较同一时刻榜单中的模型。
  • 票数 / 会话数:样本量参考;样本较少时,排名通常更容易波动。
  • 价格 $/百万Token:输入 / 输出每百万 Token 的参考价格。
  • 上下文:模型支持的最大上下文长度。

选模型时再确认三件事

  1. Provider 是否实际提供这个模型,以及你的地区和账户是否可用;
  2. API 价格、速率限制和上下文是否适合你的任务;
  3. 用 3~5 个真实任务做小规模测试,不要只看总榜名次。

数据来源

数据来自 Arena AI 官方 搜索榜单,由 GitHub Actions 每天更新。模型价格、许可证和能力请以模型服务商官方信息为准。

本页内容