OnlySOTA

Agentic work

Multi-step tasks drawn from real occupations rather than from software engineering — spreadsheets, documents, customer-facing procedures — run through a tool-using loop.

Model In top 10 Artificial Analysis LLM Leaderboard GDPval-AA Arena — Agent Overall
Claude Opus 5.5 Anthropic 2/2 #1 68.3% #1 0.143
Claude Sonnet 5.5 Anthropic 2/2 #2 67.0% #4 0.120
Claude Fable 5.1 Anthropic 2/2 #3 62.8% #3 0.127
Claude Opus 5 Anthropic 2/2 #4 61.2% #9 0.081
GPT 6 Astra OpenAI 1/2 #23 52.1% #2 0.131
Grok 4.7 SpaceXAI 1/2 #5 60.6% #20 0.028
GPT 6.1 Sol OpenAI 1/2 #21 53.8% #5 0.117
MiMo V2.6 Pro Xiaomi 1/2 #6 59.2% #18 0.035
GPT 6 Sol OpenAI 1/2 #25 50.4% #6 0.099
Muse Spark 1.3 Meta 1/2 #7 59.0% #14 0.040
Gemini 4 Argon Google 1/2 #13 56.3% #7 0.093
Qwen 3.8 Max Alibaba 1/2 #8 58.6% #22 0.023
Claude Fable 5 Anthropic 1/2 #16 55.6% #8 0.089
GLM 5.3 Z AI 1/2 #9 57.5% #23 0.021
Grok 4.6 SpaceXAI 1/2 #10 57.3% #28 0.011
Claude Opus 4.8 Anthropic 1/2 #29 47.8% #10 0.071