OnlySOTA

Multimodal

Questions that cannot be answered from the text alone. Restricted to visual reasoning for now, because that is what the sources measure.

Model In top 10 Artificial Analysis LLM Leaderboard MMMU-Pro Arena — Vision Overall (style control)
Claude Opus 5.5 Anthropic 2/2 #1 87.7% #9 1293
GPT 6.1 Sol OpenAI 2/2 #3 86.0% #6 1294
Gemini 3.7 Flash Google 2/2 #5 85.5% #5 1297
Claude Fable 5 Anthropic 1/2 — #1 1308
GPT 6 Astra OpenAI 1/2 #2 86.9% #16 1286
Qwen 3.8 Max Alibaba 1/2 #11 82.8% #2 1301
Claude Opus 4.6 Anthropic 1/2 #45 75.4% #3 1299
Gemini 3.8 Flash Google 1/2 #4 85.6% #12 1289
Claude Opus 4.7 Anthropic 1/2 #27 78.8% #4 1298
Claude Opus 5 Anthropic 1/2 #6 84.7% #13 1287
Gemini 3.5 Flash Google 1/2 #7 84.3% #19 1285
Muse Spark Meta 1/2 #17 80.5% #7 1294
GPT 5.6 Sol OpenAI 1/2 #8 83.4% #14 1287
Muse Spark 1.2 Meta 1/2 — #8 1293
Gemini 3.6 Flash Google 1/2 #9 83.2% #21 1281
GPT 6 Sol OpenAI 1/2 #10 82.9% #30 1270
Muse Spark 1.3 Meta 1/2 #13 82.0% #10 1290