多模态
只靠文字无法回答、必须看懂图片才能答对的问题。目前只涵盖看图推理,因为各榜只测了这一类。 按它在多少项基准里进入前 10 排序,一样多时看最好名次。每列保持各自的排名,不做平均。 「—」表示该榜没有收录这个模型,不是零分。尚未识别出具体模型的条目不在此处出现,但仍显示在各自的原始榜单上。
| 模型 | 进入前 10 | Artificial Analysis LLM Leaderboard MMMU-Pro | Arena — Vision Overall (style control) |
|---|---|---|---|
| | 2/2 | #1 87.7% | #9 1293 |
| | 2/2 | #3 86.0% | #6 1294 |
| | 2/2 | #5 85.5% | #5 1297 |
| | 1/2 | — | #1 1308 |
| | 1/2 | #2 86.9% | #16 1286 |
| | 1/2 | #11 82.8% | #2 1301 |
| | 1/2 | #45 75.4% | #3 1299 |
| | 1/2 | #4 85.6% | #12 1289 |
| | 1/2 | #27 78.8% | #4 1298 |
| | 1/2 | #6 84.7% | #13 1287 |
| | 1/2 | #7 84.3% | #19 1285 |
| | 1/2 | #17 80.5% | #7 1294 |
| | 1/2 | #8 83.4% | #14 1287 |
| | 1/2 | — | #8 1293 |
| | 1/2 | #9 83.2% | #21 1281 |
| | 1/2 | #10 82.9% | #30 1270 |
| | 1/2 | #13 82.0% | #10 1290 |