OnlySOTA

事實性

模型會不會說錯事實,以及不知道時會不會拒絕回答。兩項指標分開看:一項是準確率,一項是答錯卻很自信的比例,兩者並不同步變化。

模型 進入前 10 Artificial Analysis LLM Leaderboard AA-Omniscience Index Artificial Analysis LLM Leaderboard AA-Omniscience Non-Hallucination Rate Epoch AI Benchmarking Hub SimpleQA Verified
Claude Opus 5.5 Anthropic 2/3 #1 46.4 #96 41.4% #4 72.2%
GPT 6 Astra OpenAI 2/3 #2 43.7 #68 55.2% #1 75.6%
GPT 6.1 Sol OpenAI 2/3 #6 41.5 #77 50.6% #2 73.9%
Claude Fable 5.1 Anthropic 2/3 #3 43.5 #116 34.4% #5 70.8%
Gemini 3.1 Pro Google 2/3 #10 31.9 #81 49.1% #3 73.5%
Claude Fable 5 Anthropic 2/3 #4 43.3 #110 36.4% #6 70.7%
Gemini 4 Argon Google 2/3 #5 42.4 #5 84.9% —
MiniCPM5 OpenBMB 1/3 #73 -0.800 #1 99.1% —
G9v3 AI9Stars 1/3 #81 -4.367 #2 88.3% —
G9v3 39A5B AI9Stars 1/3 #54 3.767 #3 87.0% —
Command A+ Cohere 1/3 #79 -4.017 #4 85.8% —
LFM2.5 Liquid AI 1/3 #101 -10.9 #6 84.0% —
Claude Opus 5 Anthropic 1/3 #7 37.1 #98 40.5% #16 59.9%
Gemini 3.8 Flash Google 1/3 #12 29.6 #86 48.1% #7 69.7%
Grok 4.3 SpaceXAI 1/3 #27 18.0 #7 83.1% #54 33.2%
Claude Sonnet 5.5 Anthropic 1/3 #8 32.3 #72 53.0% #33 46.5%
GPT 5.6 Sol OpenAI 1/3 #22 22.0 #245 10.6% #8 69.7%
Grok 4.20 SpaceXAI 1/3 #31 14.8 #8 82.6% #58 30.2%
Grok 4.7 SpaceXAI 1/3 #9 32.0 #29 70.7% #18 56.0%
Gemini 3.7 Flash Google 1/3 #18 26.5 #113 35.5% #9 69.2%
Qwen 3.8 Alibaba 1/3 #90 -7.950 #9 81.9% —
Gemini 3 Flash Google 1/3 #42 10.1 #267 7.6% #10 66.8%
MiniMax M3 MiniMax 1/3 #59 1.350 #10 81.6% —