OnlySOTA

代理式程式設計

藉助工具迴圈解決真實程式碼儲存庫和終端機任務。這裡每個分數衡量的都是「模型 + 框架」的整體,所以同一個模型可能佔兩行,分別對應不同框架,這不是重複。

模型 進入前 10 Artificial Analysis LLM Leaderboard Terminal-Bench 4.0 Artificial Analysis Coding Agents Artificial Analysis Coding Agent Index Artificial Analysis Coding Agents Terminal-Bench v4 HarnessTax — SWE-bench Lite SWE-bench Lite HarnessTax — Terminal-Bench 2.0 Terminal-Bench 2.0 Terminal-Bench 4.0 Terminal-Bench 4.0
Claude Sonnet 5.5 Anthropic 4/6 #1 63.6% #1 0.684 #1 66.2% — — #2 61.8%
Claude Opus 5.5 Anthropic 4/6 #2 59.6% #2 0.660 #2 63.1% — — #1 64.8%
Claude Fable 5 Anthropic 4/6 #9 42.4% — — #1 97.8% #3 75.6% #8 44.5%
GPT 5.6 Sol OpenAI 4/6 #11 39.9% #10 0.546 #10 37.4% #3 77.8% #1 83.3% #11 37.3%
GPT 6 Astra OpenAI 4/6 #3 59.6% #6 0.616 #5 55.6% — — #3 58.2%
Claude Fable 5.1 Anthropic 4/6 #6 55.1% #5 0.622 #3 57.6% — — #5 57.9%
GPT 6.1 Sol OpenAI 4/6 #5 56.1% #4 0.629 #6 54.5% — — #4 58.2%
Claude Opus 5 Anthropic 4/6 #7 49.0% #7 0.597 #7 54.5% — — #6 53.9%
GPT 6 Sol OpenAI 4/6 #8 43.9% #8 0.567 #8 43.4% — — #7 49.4%
Gemini 4 Argon Google 3/6 #4 57.1% #3 0.638 #4 56.1% — — —
GLM 5.3 Z AI 3/6 #10 41.9% #12 0.536 #9 39.9% — — #9 41.8%
Claude Opus 4.8 Anthropic 2/6 #25 21.7% — — #2 88.9% #5 72.2% #14 23.6%
GPT 5.6 Luna OpenAI 2/6 #37 11.6% #17 0.432 #19 14.6% #7 55.6% #2 76.7% #18 17.3%
Kimi K3 Kimi 2/6 #34 12.6% #13 0.519 #15 21.2% #4 76.7% #4 73.3% —
Claude Sonnet 4.6 Anthropic 2/6 #45 3.0% — — #5 68.9% #6 65.6% —
Claude Haiku 4.5 Anthropic 2/6 #75 0.0% — — #6 60.0% #7 47.8% —
Grok 4.7 SpaceXAI 2/6 #22 25.8% #9 0.563 #11 33.3% — — #10 37.6%