AI 代理
不只回答一輪,而是藉助工具把一件事辦完。這裡回答兩個問題:派哪個模型上場,用哪個框架驅動它。
截至 2026-10-10:Artificial Analysis LLM Leaderboard · Terminal-Bench 4.0 第一是 Claude Sonnet 5.5(63.6%)。Artificial Analysis Coding Agent Index 第一是 Claude Sonnet 5.5(0.684)。Arena — Agent · Overall 第一是 Claude Opus 5.5(0.143)。斬殺者是 Claude Haiku 5.5,混合價每百萬 token $0.20。
- SOTA
- 13個模型
- 得分高過斬殺者
- 第一 · AA
- Claude Sonnet 5.5
- 63.6% · $4.00
- 斬殺者 · 價格
- Claude Haiku 5.5
- $0.20
- 最便宜的 SOTA
- Ling 3.1 Flash
- 33.3% · $0.45
排行 · AA 1–64% · AA-CODE 0.28–0.68 · A-AGENT -0.02–0.17這裡列出得分高過斬殺者的全部模型,最後一行是斬殺者本身,作為參照。每一列是一張榜單的成績,並排列出,從不合併;「—」表示該榜沒有收錄這個模型。點選列頭可切換排序;序號是該榜自己的名次,滑鼠懸停可檢視各榜名次。標「上一代」的模型已不在該榜的當前列表中,成績取它仍在列的最好配置。
- 163.6%0.6840.120
- 259.6%0.6600.143
- 359.6%0.6160.131
- 457.1%0.6380.093
- 556.1%0.6290.117
- 655.1%0.6220.127
- 7上一代49.0%0.5970.081
- 8上一代43.9%0.5670.099
- 9上一代42.4%—0.089
- 1041.9%0.5360.021
- 11上一代39.9%0.5460.062
- 1238.9%0.4330.023
- 1335.4%—0.009
- 1434.8%—0.035
- 15新上榜33.3%——
- 1633.3%0.5430.040
- 1733.3%0.5120.000
- 18新上榜斬殺者32.8%0.414—
斬殺線:得分 × 價格 斬殺者是全場性價比最高的模型:比它貴、得分又不更高的,都被它斬殺。每個點代表一個模型:越往右越貴,越往上得分越高。兩條虛線的交點是斬殺者。橫線以上是 SOTA,最強的一檔;左下方更便宜也更弱,是低成本之選。69 個模型中有 42 個被斬殺。淺色折線連起的,是沒有哪個模型能在價格和得分上同時勝過的模型。上一代模型不畫在圖上。點選一個模型,可在下方展開詳情。斬殺線是怎麼畫的 →歷任斬殺者 →
斬殺者是全場性價比最高的模型:比它貴、得分又不更高的,都被它斬殺。 斬殺線是怎麼畫的 →歷任斬殺者 →
斬殺線前沿線:沒有哪個模型在價格和得分上同時勝過它們SOTA低成本被斬殺空心點或淺色叉:該榜的估算值
Claude Sonnet 5.5
各榜成績 名次以各榜自己的為準:榜單公佈了名次就用它的,沒有公佈就按該榜的分數排序。橫條表示該模型在這個榜上領先了多大比例的模型。不同榜的分數不能相互比較。
- Artificial Analysis LLM Leaderboard56.0第 2 名,共 375 個
- Arena — Agent0.120第 4 名,共 52 個
- Artificial Analysis Coding Agents0.684第 1 名,共 24 個
- Epoch AI Benchmarking Hub88.8%第 7 名,共 82 個
- Terminal-Bench 4.061.8%第 2 名,共 35 個
- Arena — Code1774第 3 名,共 142 個
- Arena — Text1476第 32 名,共 414 個
- Arena — Vision1266第 39 名,共 165 個
不同推理強度下的成績 同一個模型在不同推理強度下的成績。長條從 0 畫到該榜的最高分,請逐榜閱讀,不要跨榜比較。
Artificial Analysis LLM Leaderboardmax 最高
- low35.9
- medium40.8
- high46.8
- xhigh51.9
- max56.0
Artificial Analysis Coding Agents · Claude Codemax 最高
- low0.421
- medium0.459
- high0.550
- xhigh0.629
- max0.684
Arena — Codexhigh 最高
- high1715
- xhigh1774
只測了一檔
- Arena — Agent · agentmax0.120
- Epoch AI Benchmarking Hubmax88.8%
- Terminal-Bench 4.0 · Claude Codemax61.8%
- Arena — Textxhigh1476
- Arena — Visionxhigh1266
這個場景參考哪些榜 每一欄都是一張榜單公佈的原始排名,不取平均。兩欄結論不一致,通常是因為測的本來就不是同一件事。
模型
比較模型本身,不論由什麼框架驅動。Artificial Analysis 按完成的任務打分;Arena 根據真實使用中的工具呼叫可靠性、任務完成度和指令遵循度打分。
執行框架
同一批資料換個角度看:比較的是驅動模型的代理框架。HarnessTax 讓每個模型在每個框架裡都跑一遍,所以兩行之間的差距只來自框架,但它只跑了一次就停了;Artificial Analysis 覆蓋的框架更多,但大多只搭配自家廠商的模型;Terminal-Bench 官方榜一直在收新的成績。