代码 / Web 开发榜单
本页展示 Arena AI 榜单前 30 名的每日快照,方便快速了解近期模型表现。完整榜单、筛选项和最新变化请到 Arena AI 官网查看。
本榜单评测模型在 Web 前端开发(HTML/CSS/JS)任务上的实际表现。
数据更新时间: 2026-09-19 12:14:58 UTC / 2026-09-19 20:14:58 CST (北京时间)
前 30 名
| 排名 | 排名区间 | 模型 | 分数 | 票数 | 价格 $/百万Token | 上下文 |
|---|---|---|---|---|---|---|
| 1 | 1-1 | gpt-6-astra-max 1 | 1800 (++16/-16) | 2,281 | $10 / $50 | 1.1M |
| 2 | 2-2 | claude-fable-5.1-max 1 | 1758 (++14/-14) | 3,036 | $10 / $50 | 1M |
| 3 | 3-6 | claude-opus-5-max 1 | 1687 (++7/-7) | 12,087 | $5 / $25 | 1M |
| 4 | 3-7 | qwen3.8-max-0902 1 | 1681 (++15/-15) Preliminary | 2,262 | $2 / $6 | N/A |
| 5 | 3-8 | kimi-k3-max 1 | 1674 (++11/-11) | 4,547 | $3 / $15 | 1M |
| 6 | 3-8 | qwen3.8-max 1 | 1671 (++12/-12) Preliminary | 3,221 | $2 / $6 | 1M |
| 7 | 4-8 | claude-opus-5-high 1 | 1660 (++7/-7) | 12,566 | $5 / $25 | 1M |
| 8 | 5-9 | muse-spark-1.3-max 1 | 1652 (++12/-12) | 2,972 | $1.25 / $4.25 | 1M |
| 9 | 8-16 | qwen3.8-flash-next 1 | 1635 (++13/-13) Preliminary | 2,779 | $0.16 / $0.47 | 1M |
| 10 | 9-16 | claude-fable-5-high 1 | 1628 (++7/-7) | 10,081 | $10 / $50 | 1M |
| 11 | 9-17 | hy4-preview 1 | 1624 (++13/-13) Preliminary | 2,321 | $0.83 / $2.50 | 1M |
| 12 | 9-17 | muse-spark-1.3 (xHigh) 1 | 1623 (++14/-14) | 2,123 | $1.25 / $4.25 | 1M |
| 13 | 9-17 | grok-4.6-high 1 | 1618 (++10/-10) | 4,282 | $2 / $6 | 500K |
| 14 | 9-17 | gpt-5.6-sol-xhigh (codex-harness) 1 | 1617 (++7/-7) | 11,916 | $4 / $20 | 1.1M |
| 15 | 9-17 | glm-5.3-max 1 | 1614 (++11/-11) | 3,725 | $1.40 / $4.40 | 1M |
| 16 | 9-20 | deepseek-v4.1-flash-max 1 | 1614 (++17/-17) | 1,361 | $0.30 / $1.20 | 1M |
| 17 | 11-20 | glm-5.3-flash 1 | 1607 (++12/-12) | 2,925 | $0.07 / $0.25 | 1M |
| 18 | 16-22 | qwen3.8-27b 1 | 1593 (++9/-9) | 4,913 | $0.40 / $3 | N/A |
| 19 | 16-22 | glm-5.2-max 1 | 1592 (++7/-7) | 10,516 | $1.40 / $4.40 | 1M |
| 20 | 16-23 | gemini-3.7-flash-high 1 | 1587 (++12/-12) Preliminary | 3,007 | $0.75 / $3.75 | 1M |
| 21 | 18-23 | deepseek-v4-pro-high-20260813 1 | 1581 (++10/-10) | 4,258 | $1.32 / $3.96 | N/A |
| 22 | 18-23 | deepseek-v4-flash-high 1 | 1580 (++10/-10) | 4,723 | $0.30 / $1.20 | 1M |
| 23 | 20-27 | gemini-3.8-flash-high 1 | 1568 (++12/-12) Preliminary | 2,732 | $0.75 / $3.75 | 1M |
| 24 | 23-27 | claude-opus-4-8-high 1 | 1559 (++7/-7) | 13,787 | $5 / $25 | 1M |
| 25 | 23-28 | claude-opus-4-7 1 | 1557 (++6/-6) | 15,914 | $5 / $25 | 1M |
| 26 | 23-29 | claude-opus-4-7-high 1 | 1555 (++6/-6) | 16,387 | $5 / $25 | 1M |
| 27 | 23-30 | grok-4.5 1 | 1555 (++8/-8) | 8,133 | $2 / $6 | 500K |
| 28 | 25-34 | claude-opus-4-6-high 1 | 1547 (++6/-6) | 18,332 | $5 / $25 | 1M |
| 29 | 26-34 | muse-spark-1.1 1 | 1542 (++8/-8) | 7,549 | $1.25 / $4.25 | N/A |
| 30 | 28-34 | claude-opus-4-8 1 | 1539 (++6/-6) | 12,654 | $5 / $25 | 1M |
怎么看这张表
- 排名 / 排名区间:Arena AI 根据对战投票估算的相对名次;排名区间表示在置信范围内的名次波动。
- 分数:相对评分,适合比较同一时刻榜单中的模型。
- 票数 / 会话数:样本量参考;样本较少时,排名通常更容易波动。
- 价格 $/百万Token:输入 / 输出每百万 Token 的参考价格。
- 上下文:模型支持的最大上下文长度。
选模型时再确认三件事
- Provider 是否实际提供这个模型,以及你的地区和账户是否可用;
- API 价格、速率限制和上下文是否适合你的任务;
- 用 3~5 个真实任务做小规模测试,不要只看总榜名次。
数据来源
数据来自 Arena AI 官方 代码 / Web 开发榜单,由 GitHub Actions 每天更新。模型价格、许可证和能力请以模型服务商官方信息为准。
