OnlySOTA

Factuality

Whether the model states things that are not so, and whether it declines when it does not know. Measured both as accuracy and as the rate of confident wrong answers, which move independently.

Model In top 10 Artificial Analysis LLM Leaderboard AA-Omniscience Index Artificial Analysis LLM Leaderboard AA-Omniscience Non-Hallucination Rate Epoch AI Benchmarking Hub SimpleQA Verified
Claude Opus 5.5 Anthropic 2/3 #1 46.4 #96 41.4% #4 72.2%
GPT 6 Astra OpenAI 2/3 #2 43.7 #68 55.2% #1 75.6%
GPT 6.1 Sol OpenAI 2/3 #6 41.5 #77 50.6% #2 73.9%
Claude Fable 5.1 Anthropic 2/3 #3 43.5 #116 34.4% #5 70.8%
Gemini 3.1 Pro Google 2/3 #10 31.9 #81 49.1% #3 73.5%
Claude Fable 5 Anthropic 2/3 #4 43.3 #110 36.4% #6 70.7%
Gemini 4 Argon Google 2/3 #5 42.4 #5 84.9% —
MiniCPM5 OpenBMB 1/3 #73 -0.800 #1 99.1% —
G9v3 AI9Stars 1/3 #81 -4.367 #2 88.3% —
G9v3 39A5B AI9Stars 1/3 #54 3.767 #3 87.0% —
Command A+ Cohere 1/3 #79 -4.017 #4 85.8% —
LFM2.5 Liquid AI 1/3 #101 -10.9 #6 84.0% —
Claude Opus 5 Anthropic 1/3 #7 37.1 #98 40.5% #16 59.9%
Gemini 3.8 Flash Google 1/3 #12 29.6 #86 48.1% #7 69.7%
Grok 4.3 SpaceXAI 1/3 #27 18.0 #7 83.1% #54 33.2%
Claude Sonnet 5.5 Anthropic 1/3 #8 32.3 #72 53.0% #33 46.5%
GPT 5.6 Sol OpenAI 1/3 #22 22.0 #245 10.6% #8 69.7%
Grok 4.20 SpaceXAI 1/3 #31 14.8 #8 82.6% #58 30.2%
Grok 4.7 SpaceXAI 1/3 #9 32.0 #29 70.7% #18 56.0%
Gemini 3.7 Flash Google 1/3 #18 26.5 #113 35.5% #9 69.2%
Qwen 3.8 Alibaba 1/3 #90 -7.950 #9 81.9% —
Gemini 3 Flash Google 1/3 #42 10.1 #267 7.6% #10 66.8%
MiniMax M3 MiniMax 1/3 #59 1.350 #10 81.6% —