编程
写代码、改代码。按评判方式分开看:自动跑测试打分,和由人在两份答案里二选一,结论常常不一样。
截至 2026-10-10:Artificial Analysis LLM Leaderboard · SciCode 第一是 Claude Opus 5.5(66.9%)。Arena — Code · Overall 第一是 Claude Opus 5.5(1813)。斩杀者是 Claude Haiku 5.5,混合价每百万 token $0.20。
- SOTA
- 14个模型
- 得分高过斩杀者
- 第一 · AA
- Claude Opus 5.5
- 66.9% · $8.00
- 斩杀者 · 价格
- Claude Haiku 5.5
- $0.20
- 最便宜的 SOTA
- MiMo V2.6 Pro
- 60.9% · $0.54
排行 · AA 42–67% · A-CODE 1442–1828这里列出得分高过斩杀者的全部模型,最后一行是斩杀者本身,作为参照。每一列是一张榜单的成绩,并排列出,从不合并;「—」表示该榜没有收录这个模型。点击列头可切换排序;序号是该榜自己的名次,悬停可查看各榜名次。标「上一代」的模型已不在该榜的当前列表中,成绩取它仍在列的最好配置。
- 166.9%1813
- 263.1%1744
- 361.8%1678
- 4上一代61.0%1625
- 561.0%1774
- 660.9%1629
- 7上一代59.8%1592
- 859.7%1657
- 959.5%1654
- 1059.0%1622
- 1158.9%1564
- 12上一代58.8%1542
- 1358.7%1447
- 14上一代57.8%1618
- 1557.8%1639
- 16上一代57.6%1688
- 17上一代57.4%1533
- 1856.6%1583
- 1956.5%1786
- 20上一代56.5%1617
- 21上一代56.4%1691
- 22上一代56.1%1513
- 2355.8%1755
- 24新上榜斩杀者55.0%1587
斩杀线:得分 × 价格 斩杀者是全场性价比最高的模型:比它贵、得分又不更高的,都被它斩杀。每个点代表一个模型:越往右越贵,越往上得分越高。两条虚线的交点是斩杀者。横线以上是 SOTA,最强的一档;左下方更便宜也更弱,是低成本之选。70 个模型中有 41 个被斩杀。浅色折线连起的,是没有哪个模型能在价格和得分上同时胜过的模型。上一代模型不画在图上。点选一个模型,可在下方展开详情。斩杀线是怎么画的 →历任斩杀者 →
斩杀者是全场性价比最高的模型:比它贵、得分又不更高的,都被它斩杀。 斩杀线是怎么画的 →历任斩杀者 →
斩杀线前沿线:没有哪个模型在价格和得分上同时胜过它们SOTA低成本被斩杀空心点或浅色叉:该榜的估算值
Claude Opus 5.5
各榜成绩 名次以各榜自己的为准:榜单公布了名次就用它的,没有公布就按该榜的分数排序。横条表示该模型在这个榜上领先了多大比例的模型。不同榜的分数不能相互比较。
- Artificial Analysis LLM Leaderboard57.6第 1 名,共 375 个
- Arena — Agent0.143第 1 名,共 52 个
- Artificial Analysis Coding Agents0.660第 2 名,共 24 个
- Epoch AI Benchmarking Hub91.2%第 3 名,共 82 个
- Terminal-Bench 4.064.8%第 1 名,共 35 个
- Arena — Code1813第 1 名,共 142 个
- Arena — Text1507第 2 名,共 414 个
- Arena — Vision1293第 11 名,共 165 个
不同推理强度下的成绩 同一个模型在不同推理强度下的成绩。条形从 0 画到该榜的最高分,请逐榜阅读,不要跨榜比较。
Artificial Analysis LLM Leaderboardmax 最高
- low42.3
- medium51.2
- high53.6
- xhigh56.0
- max57.6
只测了一档
- Arena — Agent · agenthigh0.143
- Artificial Analysis Coding Agents · Claude Codemax0.660
- Epoch AI Benchmarking Hubmax91.2%
- Terminal-Bench 4.0 · Claude Codemax64.8%
- Arena — Codemax1813
- Arena — Texthigh1507
- Arena — Visionhigh1293
这个场景参考哪些榜 每一栏都是一张榜单公布的原始排名,不取平均。两栏结论不一致,通常是因为测的本来就不是同一件事。
网页开发
由人在两个已完成的网页应用之间选出更好的一个。Arena 的 Code Arena 全部是网页开发任务,所以这里按它实际测的内容,称为网页开发榜。