智能体
不只回答一轮,而是借助工具把一件事办完。这里回答两个问题:派哪个模型上场,用哪个框架驱动它。
截至 2026-10-10:Artificial Analysis LLM Leaderboard · Terminal-Bench 4.0 第一是 Claude Sonnet 5.5(63.6%)。Artificial Analysis Coding Agent Index 第一是 Claude Sonnet 5.5(0.684)。Arena — Agent · Overall 第一是 Claude Opus 5.5(0.143)。斩杀者是 Claude Haiku 5.5,混合价每百万 token $0.20。
- SOTA
- 13个模型
- 得分高过斩杀者
- 第一 · AA
- Claude Sonnet 5.5
- 63.6% · $4.00
- 斩杀者 · 价格
- Claude Haiku 5.5
- $0.20
- 最便宜的 SOTA
- Ling 3.1 Flash
- 33.3% · $0.45
排行 · AA 1–64% · AA-CODE 0.28–0.68 · A-AGENT -0.02–0.17这里列出得分高过斩杀者的全部模型,最后一行是斩杀者本身,作为参照。每一列是一张榜单的成绩,并排列出,从不合并;「—」表示该榜没有收录这个模型。点击列头可切换排序;序号是该榜自己的名次,悬停可查看各榜名次。标「上一代」的模型已不在该榜的当前列表中,成绩取它仍在列的最好配置。
- 163.6%0.6840.120
- 259.6%0.6600.143
- 359.6%0.6160.131
- 457.1%0.6380.093
- 556.1%0.6290.117
- 655.1%0.6220.127
- 7上一代49.0%0.5970.081
- 8上一代43.9%0.5670.099
- 9上一代42.4%—0.089
- 1041.9%0.5360.021
- 11上一代39.9%0.5460.062
- 1238.9%0.4330.023
- 1335.4%—0.009
- 1434.8%—0.035
- 15新上榜33.3%——
- 1633.3%0.5430.040
- 1733.3%0.5120.000
- 18新上榜斩杀者32.8%0.414—
斩杀线:得分 × 价格 斩杀者是全场性价比最高的模型:比它贵、得分又不更高的,都被它斩杀。每个点代表一个模型:越往右越贵,越往上得分越高。两条虚线的交点是斩杀者。横线以上是 SOTA,最强的一档;左下方更便宜也更弱,是低成本之选。69 个模型中有 42 个被斩杀。浅色折线连起的,是没有哪个模型能在价格和得分上同时胜过的模型。上一代模型不画在图上。点选一个模型,可在下方展开详情。斩杀线是怎么画的 →历任斩杀者 →
斩杀者是全场性价比最高的模型:比它贵、得分又不更高的,都被它斩杀。 斩杀线是怎么画的 →历任斩杀者 →
斩杀线前沿线:没有哪个模型在价格和得分上同时胜过它们SOTA低成本被斩杀空心点或浅色叉:该榜的估算值
Claude Sonnet 5.5
各榜成绩 名次以各榜自己的为准:榜单公布了名次就用它的,没有公布就按该榜的分数排序。横条表示该模型在这个榜上领先了多大比例的模型。不同榜的分数不能相互比较。
- Artificial Analysis LLM Leaderboard56.0第 2 名,共 375 个
- Arena — Agent0.120第 4 名,共 52 个
- Artificial Analysis Coding Agents0.684第 1 名,共 24 个
- Epoch AI Benchmarking Hub88.8%第 7 名,共 82 个
- Terminal-Bench 4.061.8%第 2 名,共 35 个
- Arena — Code1774第 3 名,共 142 个
- Arena — Text1476第 32 名,共 414 个
- Arena — Vision1266第 39 名,共 165 个
不同推理强度下的成绩 同一个模型在不同推理强度下的成绩。条形从 0 画到该榜的最高分,请逐榜阅读,不要跨榜比较。
Artificial Analysis LLM Leaderboardmax 最高
- low35.9
- medium40.8
- high46.8
- xhigh51.9
- max56.0
Artificial Analysis Coding Agents · Claude Codemax 最高
- low0.421
- medium0.459
- high0.550
- xhigh0.629
- max0.684
Arena — Codexhigh 最高
- high1715
- xhigh1774
只测了一档
- Arena — Agent · agentmax0.120
- Epoch AI Benchmarking Hubmax88.8%
- Terminal-Bench 4.0 · Claude Codemax61.8%
- Arena — Textxhigh1476
- Arena — Visionxhigh1266
这个场景参考哪些榜 每一栏都是一张榜单公布的原始排名,不取平均。两栏结论不一致,通常是因为测的本来就不是同一件事。
模型
比较模型本身,不论由什么框架驱动。Artificial Analysis 按完成的任务打分;Arena 根据真实使用中的工具调用可靠性、任务完成度和指令遵循度打分。
执行框架
同一批数据换个角度看:比较的是驱动模型的智能体框架。HarnessTax 让每个模型在每个框架里都跑一遍,所以两行之间的差距只来自框架,但它只跑了一次就停了;Artificial Analysis 覆盖的框架更多,但大多只搭配自家厂商的模型;Terminal-Bench 官方榜一直在收新的成绩。