OnlySOTA

Coding

Writing and editing code against a specification, measured without an agent loop. Distinct from agentic coding: these benchmarks score the model's output directly rather than a model-plus-harness system.

Model In top 10 Artificial Analysis LLM Leaderboard SciCode Arena — Code Overall
Claude Opus 5.5 Anthropic 2/2 #1 66.9% #1 1813
Claude Fable 5.1 Anthropic 2/2 #2 63.1% #5 1744
Gemini 4 Argon Google 2/2 #3 61.8% #8 1678
Claude Sonnet 5.5 Anthropic 2/2 #5 61.0% #3 1774
Muse Spark 1.3 Meta 2/2 #8 59.7% #10 1657
GPT 6 Astra OpenAI 1/2 #19 56.5% #2 1786
Claude Fable 5 Anthropic 1/2 #4 61.0% #17 1625
GPT 6.1 Sol OpenAI 1/2 #23 55.8% #4 1755
MiMo V2.6 Pro Xiaomi 1/2 #6 60.9% #16 1629
Claude Opus 5 Anthropic 1/2 #21 56.4% #6 1691
Gemini 3.7 Flash Google 1/2 #7 59.8% #25 1592
GPT 6 Sol OpenAI 1/2 #16 57.6% #7 1688
Kimi K3 Kimi 1/2 #9 59.5% #11 1654
Qwen 3.8 Max Alibaba 1/2 #32 54.1% #9 1674
GLM 5.3 Z AI 1/2 #10 59.0% #18 1622