OnlySOTA

推理與知識

有標準答案、難在推理而不在記憶的難題:專家級的考題、未公開的物理研究題和研究級的數學題。

模型 進入前 10 Artificial Analysis LLM Leaderboard Humanity's Last Exam Artificial Analysis LLM Leaderboard CritPt Epoch AI Benchmarking Hub FrontierMath Tiers 1–3 Epoch AI Benchmarking Hub FrontierMath Tier 4
Claude Opus 5.5 Anthropic 4/4 #1 61.4% #2 31.7% #3 91.2% #3 95.0%
GPT 6 Astra OpenAI 4/4 #7 54.7% #3 31.7% #1 93.7% #2 97.6%
GPT 6.1 Sol OpenAI 4/4 #8 52.9% #4 31.7% #2 93.7% #1 100.0%
GPT 5.6 Sol OpenAI 4/4 #9 49.5% #1 32.3% #6 89.1% #7 82.9%
Claude Fable 5.1 Anthropic 4/4 #2 59.1% #6 31.1% #4 90.2% #6 87.8%
Claude Sonnet 5.5 Anthropic 4/4 #5 55.0% #5 31.4% #7 88.8% #8 80.5%
Claude Fable 5 Anthropic 3/4 #4 55.5% #12 28.6% #9 87.0% #4 90.2%
GPT 6 Sol OpenAI 3/4 #13 47.9% #7 30.9% #5 89.8% #5 90.0%
GPT 5.5 Pro OpenAI 3/4 — #8 30.6% #8 87.7% #9 78.0%
Claude Opus 5 Anthropic 2/4 #6 54.9% #11 29.1% #11 85.6% #10 73.2%
GPT 5.6 Terra OpenAI 2/4 #28 42.9% #10 30.0% #10 86.0% #12 70.7%
Gemini 4 Argon Google 1/4 #3 57.1% #14 27.1% — —
GPT 5.4 Pro OpenAI 1/4 — #9 30.0% #13 82.5% #14 58.5%
MiMo V2.6 Pro Xiaomi 1/4 #10 49.4% #15 26.6% — —