OnlySOTA

智能体

不只回答一轮,而是借助工具把一件事办完。这里回答两个问题:派哪个模型上场,用哪个框架驱动它。

截至 2026-10-10:Artificial Analysis LLM Leaderboard · Terminal-Bench 4.0 第一是 Claude Sonnet 5.5(63.6%)。Artificial Analysis Coding Agent Index 第一是 Claude Sonnet 5.5(0.684)。Arena — Agent · Overall 第一是 Claude Opus 5.5(0.143)。斩杀者是 Claude Haiku 5.5,混合价每百万 token $0.20。

SOTA
13个模型
得分高过斩杀者
第一 · AA
Claude Sonnet 5.5
63.6% · $4.00
斩杀者 · 价格
Claude Haiku 5.5
$0.20
最便宜的 SOTA
Ling 3.1 Flash
33.3% · $0.45
排行 · AA 1–64% · AA-CODE 0.28–0.68 · A-AGENT -0.02–0.17
  1. 163.6%0.6840.120
  2. 259.6%0.6600.143
  3. 359.6%0.6160.131
  4. 457.1%0.6380.093
  5. 556.1%0.6290.117
  6. 655.1%0.6220.127
  7. 7上一代49.0%0.5970.081
  8. 8上一代43.9%0.5670.099
  9. 9上一代42.4%—0.089
  10. 1041.9%0.5360.021
  11. 11上一代39.9%0.5460.062
  12. 1238.9%0.4330.023
  13. 1335.4%—0.009
  14. 1434.8%—0.035
  15. 15新上榜33.3%——
  16. 1633.3%0.5430.040
  17. 1733.3%0.5120.000
  18. 18新上榜斩杀者32.8%0.414—
查看 AA 的全部 119 个模型 →
斩杀线:得分 × 价格

斩杀者是全场性价比最高的模型:比它贵、得分又不更高的,都被它斩杀。 斩杀线是怎么画的 →历任斩杀者 →

Terminal-Bench 4.0 · 刻度从 0 开始20%40%60%0$0.05$0.25$1.00$20.0063.6%$4.00Claude Sonnet 5.5斩杀者Claude Haiku 5.532.8% · $0.20SOTA低成本被斩杀Blended Price, USD per 1M tokens (3:1 input:output) · log10
斩杀线前沿线:没有哪个模型在价格和得分上同时胜过它们SOTA低成本被斩杀空心点或浅色叉:该榜的估算值

Claude Sonnet 5.5

anthropic/claude-sonnet-5-5 · 闭源 · $4.00 · SOTA

查看完整页面 →
各榜成绩
  • Artificial Analysis LLM Leaderboard56.0第 2 名,共 375 个
  • Arena — Agent0.120第 4 名,共 52 个
  • Artificial Analysis Coding Agents0.684第 1 名,共 24 个
  • Epoch AI Benchmarking Hub88.8%第 7 名,共 82 个
  • Terminal-Bench 4.061.8%第 2 名,共 35 个
  • Arena — Code1774第 3 名,共 142 个
  • Arena — Text1476第 32 名,共 414 个
  • Arena — Vision1266第 39 名,共 165 个
不同推理强度下的成绩

Artificial Analysis LLM Leaderboardmax 最高

  1. low35.9
  2. medium40.8
  3. high46.8
  4. xhigh51.9
  5. max56.0

Artificial Analysis Coding Agents · Claude Codemax 最高

  1. low0.421
  2. medium0.459
  3. high0.550
  4. xhigh0.629
  5. max0.684

Arena — Codexhigh 最高

  1. high1715
  2. xhigh1774

只测了一档

  • Arena — Agent · agentmax0.120
  • Epoch AI Benchmarking Hubmax88.8%
  • Terminal-Bench 4.0 · Claude Codemax61.8%
  • Arena — Textxhigh1476
  • Arena — Visionxhigh1266

这个场景参考哪些榜

模型

比较模型本身,不论由什么框架驱动。Artificial Analysis 按完成的任务打分;Arena 根据真实使用中的工具调用可靠性、任务完成度和指令遵循度打分。

执行框架

同一批数据换个角度看:比较的是驱动模型的智能体框架。HarnessTax 让每个模型在每个框架里都跑一遍,所以两行之间的差距只来自框架,但它只跑了一次就停了;Artificial Analysis 覆盖的框架更多,但大多只搭配自家厂商的模型;Terminal-Bench 官方榜一直在收新的成绩。