家族榜:每条产品线以最强模型出战
每个家族(如 Claude Opus、Gemini Flash)由其中最强的一款代表,整行原样取用。
- SOTA
- 13个模型
- 得分高过斩杀者
- 第一 · AA
- Claude Opus 5.5
- 57.6 · $8.00
- 斩杀者 · 价格
- Claude Haiku 5.5
- $0.20
- 最便宜的 SOTA
- MiMo V2.6 Pro
- 46.3 · $0.54
排行 · AA 28–58 · ARENA 1416–1534这里列出得分高过斩杀者的全部模型,最后一行是斩杀者本身,作为参照。每一列是一张榜单的成绩,并排列出,从不合并;「—」表示该榜没有收录这个模型。点击列头可切换排序;序号是该榜自己的名次,悬停可查看各榜名次。标「上一代」的模型已不在该榜的当前列表中,成绩取它仍在列的最好配置。
- 1成绩来自 Claude Opus 5.557.61507
- 2成绩来自 GPT 6 Astra52.71475
- 352.61525
- 448.11494
- 5成绩来自 Grok 4.746.41443
- 646.31480
- 745.41483
- 844.81478
- 943.71447
- 1043.61488
- 11新上榜斩杀者43.4—
斩杀线:得分 × 价格 斩杀者是全场性价比最高的模型:比它贵、得分又不更高的,都被它斩杀。每个点代表一个模型:越往右越贵,越往上得分越高。两条虚线的交点是斩杀者。横线以上是 SOTA,最强的一档;左下方更便宜也更弱,是低成本之选。102 个模型中有 65 个被斩杀。浅色折线连起的,是没有哪个模型能在价格和得分上同时胜过的模型。上一代模型不画在图上。点选一个模型,可在下方展开详情。斩杀线是怎么画的 →历任斩杀者 →
斩杀者是全场性价比最高的模型:比它贵、得分又不更高的,都被它斩杀。 斩杀线是怎么画的 →历任斩杀者 →
斩杀线前沿线:没有哪个模型在价格和得分上同时胜过它们SOTA低成本被斩杀空心点或浅色叉:该榜的估算值
Claude Opus 5.5
各榜成绩 名次以各榜自己的为准:榜单公布了名次就用它的,没有公布就按该榜的分数排序。横条表示该模型在这个榜上领先了多大比例的模型。不同榜的分数不能相互比较。
- Artificial Analysis LLM Leaderboard57.6第 1 名,共 375 个
- Arena — Agent0.143第 1 名,共 52 个
- Artificial Analysis Coding Agents0.660第 2 名,共 24 个
- Epoch AI Benchmarking Hub91.2%第 3 名,共 82 个
- Terminal-Bench 4.064.8%第 1 名,共 35 个
- Arena — Code1813第 1 名,共 142 个
- Arena — Text1507第 2 名,共 414 个
- Arena — Vision1293第 11 名,共 165 个
不同推理强度下的成绩 同一个模型在不同推理强度下的成绩。条形从 0 画到该榜的最高分,请逐榜阅读,不要跨榜比较。
Artificial Analysis LLM Leaderboardmax 最高
- low42.3
- medium51.2
- high53.6
- xhigh56.0
- max57.6
只测了一档
- Arena — Agent · agenthigh0.143
- Artificial Analysis Coding Agents · Claude Codemax0.660
- Epoch AI Benchmarking Hubmax91.2%
- Terminal-Bench 4.0 · Claude Codemax64.8%
- Arena — Codemax1813
- Arena — Texthigh1507
- Arena — Visionhigh1293