事實性
模型會不會說錯事實,以及不知道時會不會拒絕回答。兩項指標分開看:一項是準確率,一項是答錯卻很自信的比例,兩者並不同步變化。 按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。 「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。
| 模型 | 進入前 10 | Artificial Analysis LLM Leaderboard AA-Omniscience Index | Artificial Analysis LLM Leaderboard AA-Omniscience Non-Hallucination Rate | Epoch AI Benchmarking Hub SimpleQA Verified |
|---|---|---|---|---|
| | 2/3 | #1 46.4 | #96 41.4% | #4 72.2% |
| | 2/3 | #2 43.7 | #68 55.2% | #1 75.6% |
| | 2/3 | #6 41.5 | #77 50.6% | #2 73.9% |
| | 2/3 | #3 43.5 | #116 34.4% | #5 70.8% |
| | 2/3 | #10 31.9 | #81 49.1% | #3 73.5% |
| | 2/3 | #4 43.3 | #110 36.4% | #6 70.7% |
| | 2/3 | #5 42.4 | #5 84.9% | — |
| | 1/3 | #73 -0.800 | #1 99.1% | — |
| | 1/3 | #81 -4.367 | #2 88.3% | — |
| | 1/3 | #54 3.767 | #3 87.0% | — |
| | 1/3 | #79 -4.017 | #4 85.8% | — |
| | 1/3 | #101 -10.9 | #6 84.0% | — |
| | 1/3 | #7 37.1 | #98 40.5% | #16 59.9% |
| | 1/3 | #12 29.6 | #86 48.1% | #7 69.7% |
| | 1/3 | #27 18.0 | #7 83.1% | #54 33.2% |
| | 1/3 | #8 32.3 | #72 53.0% | #33 46.5% |
| | 1/3 | #22 22.0 | #245 10.6% | #8 69.7% |
| | 1/3 | #31 14.8 | #8 82.6% | #58 30.2% |
| | 1/3 | #9 32.0 | #29 70.7% | #18 56.0% |
| | 1/3 | #18 26.5 | #113 35.5% | #9 69.2% |
| | 1/3 | #90 -7.950 | #9 81.9% | — |
| | 1/3 | #42 10.1 | #267 7.6% | #10 66.8% |
| | 1/3 | #59 1.350 | #10 81.6% | — |