程式設計
寫程式碼、改程式碼。按評判方式分開看:自動跑測試打分,和由人在兩份答案裡二選一,結論常常不一樣。
截至 2026-10-10:Artificial Analysis LLM Leaderboard · SciCode 第一是 Claude Opus 5.5(66.9%)。Arena — Code · Overall 第一是 Claude Opus 5.5(1813)。斬殺者是 Claude Haiku 5.5,混合價每百萬 token $0.20。
- SOTA
- 14個模型
- 得分高過斬殺者
- 第一 · AA
- Claude Opus 5.5
- 66.9% · $8.00
- 斬殺者 · 價格
- Claude Haiku 5.5
- $0.20
- 最便宜的 SOTA
- MiMo V2.6 Pro
- 60.9% · $0.54
排行 · AA 42–67% · A-CODE 1442–1828這裡列出得分高過斬殺者的全部模型,最後一行是斬殺者本身,作為參照。每一列是一張榜單的成績,並排列出,從不合併;「—」表示該榜沒有收錄這個模型。點選列頭可切換排序;序號是該榜自己的名次,滑鼠懸停可檢視各榜名次。標「上一代」的模型已不在該榜的當前列表中,成績取它仍在列的最好配置。
- 166.9%1813
- 263.1%1744
- 361.8%1678
- 4上一代61.0%1625
- 561.0%1774
- 660.9%1629
- 7上一代59.8%1592
- 859.7%1657
- 959.5%1654
- 1059.0%1622
- 1158.9%1564
- 12上一代58.8%1542
- 1358.7%1447
- 14上一代57.8%1618
- 1557.8%1639
- 16上一代57.6%1688
- 17上一代57.4%1533
- 1856.6%1583
- 1956.5%1786
- 20上一代56.5%1617
- 21上一代56.4%1691
- 22上一代56.1%1513
- 2355.8%1755
- 24新上榜斬殺者55.0%1587
斬殺線:得分 × 價格 斬殺者是全場性價比最高的模型:比它貴、得分又不更高的,都被它斬殺。每個點代表一個模型:越往右越貴,越往上得分越高。兩條虛線的交點是斬殺者。橫線以上是 SOTA,最強的一檔;左下方更便宜也更弱,是低成本之選。70 個模型中有 41 個被斬殺。淺色折線連起的,是沒有哪個模型能在價格和得分上同時勝過的模型。上一代模型不畫在圖上。點選一個模型,可在下方展開詳情。斬殺線是怎麼畫的 →歷任斬殺者 →
斬殺者是全場性價比最高的模型:比它貴、得分又不更高的,都被它斬殺。 斬殺線是怎麼畫的 →歷任斬殺者 →
斬殺線前沿線:沒有哪個模型在價格和得分上同時勝過它們SOTA低成本被斬殺空心點或淺色叉:該榜的估算值
Claude Opus 5.5
各榜成績 名次以各榜自己的為準:榜單公佈了名次就用它的,沒有公佈就按該榜的分數排序。橫條表示該模型在這個榜上領先了多大比例的模型。不同榜的分數不能相互比較。
- Artificial Analysis LLM Leaderboard57.6第 1 名,共 375 個
- Arena — Agent0.143第 1 名,共 52 個
- Artificial Analysis Coding Agents0.660第 2 名,共 24 個
- Epoch AI Benchmarking Hub91.2%第 3 名,共 82 個
- Terminal-Bench 4.064.8%第 1 名,共 35 個
- Arena — Code1813第 1 名,共 142 個
- Arena — Text1507第 2 名,共 414 個
- Arena — Vision1293第 11 名,共 165 個
不同推理強度下的成績 同一個模型在不同推理強度下的成績。長條從 0 畫到該榜的最高分,請逐榜閱讀,不要跨榜比較。
Artificial Analysis LLM Leaderboardmax 最高
- low42.3
- medium51.2
- high53.6
- xhigh56.0
- max57.6
只測了一檔
- Arena — Agent · agenthigh0.143
- Artificial Analysis Coding Agents · Claude Codemax0.660
- Epoch AI Benchmarking Hubmax91.2%
- Terminal-Bench 4.0 · Claude Codemax64.8%
- Arena — Codemax1813
- Arena — Texthigh1507
- Arena — Visionhigh1293
這個場景參考哪些榜 每一欄都是一張榜單公佈的原始排名,不取平均。兩欄結論不一致,通常是因為測的本來就不是同一件事。
網頁開發
由人在兩個已完成的網頁應用程式之間選出更好的一個。Arena 的 Code Arena 全部是網頁開發任務,所以這裡按它實際測的內容,稱為網頁開發榜。