OnlySOTA

Artificial Analysis LLM Leaderboard

按 Artificial Analysis 發布的原樣呈現,指標和模型都以它為準。

發布方
Artificial Analysis
授權條款
未註明
更新頻率
持續更新
本站抓取時間
2026-10-10
條目數
697 · 2 條未識別
按 Artificial Analysis Intelligence Index 排名前 12 的模型
  1. Claude Opus 5.5 57.6
  2. Claude Sonnet 5.5 56.0
  3. Claude Fable 5.1 53.4
  4. GPT 6 Astra 52.7
  5. Gemini 4 Argon 52.6
  6. GPT 6.1 Sol 51.8
  7. Claude Opus 5 50.8
  8. Claude Fable 5 49.6
  9. Muse Spark 1.3 48.1
  10. GPT 6 Sol 47.6
  11. GPT 5.6 Sol 47.0
  12. Grok 4.7 46.4

687 個有分數 · 10 個未測

#模型
1Claude Opus 5.5↗Default · maxAnthropic57.6—61.4%66.9%31.7%——68.3%84.7%46.459.6%41.4%—87.7%$8.0096/s662.12s
2Claude Sonnet 5.5↗Default · maxAnthropic56.0—55.0%61.0%31.4%——67.0%82.7%32.363.6%53.0%——$4.00141/s487.11s
3Claude Opus 5.5↗Default · xhighAnthropic56.0—57.5%65.0%31.7%——66.9%84.7%42.659.6%34.3%—86.6%$8.0081/s127.81s
4Claude Opus 5.5↗Default · highAnthropic53.6—55.6%60.4%30.9%——60.3%82.7%40.656.6%32.4%—85.8%$8.0077/s36.37s
5Claude Fable 5.1↗Default · maxAnthropic53.493.7%59.1%63.1%29.7%47.2%91.4%62.8%85.3%43.552.0%27.4%——$20.0070/s290.83s
6Claude Fable 5.1↗Default · xhighAnthropic53.293.4%58.7%60.9%31.1%45.8%91.0%61.7%83.0%42.455.1%29.5%——$20.0060/s85.17s
7GPT 6 Astra↗maxOpenAI52.796.1%54.7%56.5%31.7%41.4%88.4%52.1%80.7%43.459.1%48.7%—86.9%$20.0047/s383.62s
8Gemini 4 Argon↗highGoogle52.6—57.1%61.8%27.1%——56.3%79.7%42.457.1%84.9%——$4.00——
9GPT 6 Astra↗xhighOpenAI52.496.3%54.6%55.7%31.4%43.1%89.1%50.8%80.0%43.459.6%51.7%—86.2%$20.0043/s203.38s
10Claude Sonnet 5.5↗Default · xhighAnthropic51.9—50.0%57.3%31.1%——61.5%79.7%23.557.1%37.1%——$4.00104/s29.74s
11GPT 6.1 Sol↗maxOpenAI51.8—52.9%54.2%31.7%——53.8%83.0%41.556.1%45.7%—86.0%$4.0056/s326.94s
12Claude Opus 5.5↗Default · mediumAnthropic51.2—54.7%59.3%27.7%——54.3%84.3%40.352.5%31.6%—85.7%$8.0076/s21.66s
13Claude Fable 5.1↗Default · highAnthropic51.290.6%55.9%58.7%30.3%43.1%89.9%56.8%83.7%40.852.0%31.2%——$20.0054/s22.17s
14GPT 6.1 Sol↗xhighOpenAI51.0—52.6%55.7%31.7%——50.5%79.7%40.954.0%49.1%—85.1%$4.0053/s151.52s
15GPT 6 Astra↗highOpenAI50.994.9%53.1%55.4%28.9%40.0%89.9%49.2%80.0%43.754.0%55.2%—86.4%$20.0042/s83.11s
16Claude Opus 5↗maxAnthropic50.893.2%54.9%56.4%29.1%42.1%89.1%61.2%79.3%37.149.0%39.2%—84.7%$10.0052/s58.93s
17GPT 6.1 Sol↗highOpenAI50.2—51.4%55.8%30.0%——49.3%82.3%41.551.5%50.6%—84.9%$4.0050/s59.96s
18Claude Opus 5↗xhighAnthropic49.793.7%54.4%55.7%27.7%43.3%88.0%59.6%80.3%35.446.5%40.5%—84.0%$10.0051/s33.10s
19Claude Fable 5↗Opus 4.8 · maxAnthropic49.692.6%55.5%61.0%28.6%38.1%84.6%55.6%82.3%43.342.4%36.4%63.5%—$20.0065/s117.68s
20GPT 6 Astra↗mediumOpenAI49.693.9%52.7%54.2%29.1%35.5%89.5%48.4%79.7%42.249.5%53.5%—85.1%$20.0041/s6.03s
21Claude Fable 5.1↗Default · mediumAnthropic48.988.6%53.8%56.4%29.1%41.0%88.0%52.5%84.7%37.644.9%30.9%——$20.0054/s4.51s
22Claude Opus 5↗highAnthropic48.193.7%52.8%55.4%28.3%44.7%87.6%54.7%79.0%33.746.0%38.8%—82.4%$10.0054/s20.36s
23Muse Spark 1.3↗maxMeta48.193.5%48.7%58.8%24.9%50.5%84.3%59.0%83.0%25.033.3%67.1%——$2.00175/s59.10s
24GPT 6.1 Sol↗mediumOpenAI47.8—49.9%53.2%27.7%——46.6%83.3%40.048.0%48.4%—83.9%$4.0049/s5.76s
25GPT 6 Sol↗maxOpenAI47.6—47.9%57.6%30.9%——50.4%83.7%27.143.9%39.9%—82.9%$4.0086/s130.45s
26GPT 5.6 Sol↗maxOpenAI47.094.1%49.5%57.1%32.3%44.3%88.0%55.6%84.0%22.039.9%7.8%72.7%83.4%$8.0074/s85.27s
27Claude Fable 5.1↗Default · lowAnthropic46.888.1%48.9%56.7%27.7%39.0%85.0%48.4%82.3%34.140.4%34.4%——$20.0053/s2.84s
28Claude Sonnet 5.5↗Default · highAnthropic46.8—45.8%53.7%24.6%——52.5%78.0%20.943.9%35.4%——$4.00101/s11.87s
29Grok 4.7↗xhighSpaceXAI46.4—43.1%57.4%17.7%——60.6%76.7%32.025.8%70.7%——$3.0074/s107.16s
30Grok 4.7↗highSpaceXAI46.3—42.3%57.8%18.0%——60.4%77.0%30.924.7%67.6%——$3.0064/s50.24s
31MiMo V2.6 Pro↗Xiaomi46.3—49.4%60.9%26.6%——59.2%86.3%8.434.8%59.4%——$0.5443/s4.11s
32GPT 6 Astra↗lowOpenAI45.893.1%49.2%54.1%26.3%32.0%88.0%43.3%80.0%40.541.9%53.1%—84.6%$20.0042/s2.69s
33Qwen 3.8 Max↗0902Alibaba45.492.8%43.1%52.1%17.7%47.8%88.8%58.6%80.3%12.038.9%71.2%—82.8%$3.0036/s2.93s
34Muse Spark 1.3↗xhighMeta45.194.1%47.5%59.7%26.0%47.2%85.4%56.5%83.0%23.116.7%68.5%—82.0%$2.00280/s48.77s
35Claude Opus 5↗mediumAnthropic44.891.9%51.3%51.5%26.9%38.6%86.1%49.6%82.0%31.034.3%39.3%—81.6%$10.0051/s4.83s
36GLM 5.3↗maxZ AI44.891.7%42.3%59.0%19.1%50.3%83.9%57.5%79.7%14.341.9%70.4%——$2.1583/s2.56s
37Grok 4.6↗highSpaceXAI44.394.9%42.9%56.5%17.1%50.7%88.4%56.1%80.3%30.521.2%65.7%——$3.0058/s41.93s
38GPT 6 Sol↗xhighOpenAI44.2—46.3%55.1%28.0%——47.9%81.3%26.730.3%41.1%—82.5%$4.0085/s49.94s
39Grok 4.6↗xhighSpaceXAI44.293.5%44.1%53.0%19.7%43.3%88.0%57.3%81.0%29.317.2%76.0%——$3.0057/s47.63s
40GPT 5.6 Sol↗xhighOpenAI44.093.1%47.3%57.1%28.6%38.1%89.5%53.6%82.3%21.024.7%8.1%71.0%82.7%$8.0073/s34.91s
41Step 5↗previewStepFun43.7—46.5%58.9%20.9%——54.2%88.3%16.433.3%57.0%—76.4%$1.4387/s2.82s
42Kimi K3↗maxKimi43.693.5%46.9%59.5%23.4%46.0%85.0%51.7%88.7%19.712.6%46.8%—80.5%$6.0041/s3.52s
43Claude Haiku 5.5↗maxAnthropic43.4—44.4%55.0%18.9%——55.9%82.7%10.732.8%59.6%——$0.20240/s289.46s
44Grok 4.6↗mediumSpaceXAI42.893.5%42.1%55.9%17.7%44.3%84.3%55.9%81.0%28.013.1%76.0%——$3.0055/s33.88s
45GPT 6 Sol↗highOpenAI42.4—44.1%54.9%25.4%——44.7%83.7%26.826.3%41.9%—82.0%$4.0089/s26.56s
46GPT 5.6 Sol↗highOpenAI42.392.8%46.0%57.8%25.7%36.7%87.3%50.2%81.7%20.420.7%8.8%69.2%81.8%$8.0076/s20.45s
47Claude Opus 5.5↗Default · lowAnthropic42.3—48.3%58.6%17.7%——36.8%80.7%38.931.3%32.4%—84.7%$8.0071/s8.65s
48Grok 4.7↗lowSpaceXAI42.2—39.2%54.9%13.4%——54.4%80.0%29.616.2%60.1%—78.2%$3.0060/s5.46s
49GPT 6.1 Sol↗lowOpenAI42.1—47.4%53.2%24.9%——39.9%84.0%37.630.8%48.4%—83.1%$4.0047/s2.80s
50GPT 5.6 Terra↗maxOpenAI42.192.5%42.9%55.0%30.0%40.2%88.0%47.7%83.0%0.135.4%12.1%71.2%80.7%$4.50108/s113.73s
51GLM 5.3 Flash↗Z AI41.891.2%39.9%51.6%15.4%47.2%84.3%57.2%80.0%7.532.8%72.4%——$0.2453/s3.04s
52Claude Opus 4.8↗maxAnthropic41.892.0%48.7%54.4%20.9%34.2%84.6%47.8%77.7%28.821.7%60.7%62.2%—$10.0058/s33.73s
53Claude Haiku 5.5↗xhighAnthropic41.2—42.7%51.7%22.6%——50.5%78.3%6.029.3%55.6%——$0.20188/s57.12s
54Ling 3.1 Flash↗InclusionAI41.1—39.4%54.1%18.0%——56.1%83.0%2.233.3%62.1%——$0.45214/s1.76s
55Gemini 3.8 Flash↗highGoogle40.995.3%47.8%56.6%18.3%44.9%87.6%46.8%81.3%29.619.7%44.8%—85.6%$1.50125/s27.18s
56Claude Sonnet 5.5↗Default · mediumAnthropic40.8—39.8%52.9%16.9%——41.2%76.3%20.129.8%48.8%——$4.0099/s1.87s
57Claude Opus 4.7↗maxAnthropic40.7估算91.4%42.3%—12.0%34.6%83.1%42.8%78.7%27.3—57.7%58.6%78.8%$10.0049/s19.96s
58Qwen 3.8 Max↗Alibaba40.292.7%43.0%53.2%20.0%51.3%81.3%55.2%78.3%3.418.7%58.3%—82.3%$3.0037/s2.73s
59Qwen 3.8 Max↗Alibaba39.993.5%42.4%54.1%20.0%49.1%82.0%55.6%80.3%4.311.1%60.8%——$3.0037/s2.99s
60Qwen 3.8 Flash Next↗Alibaba39.892.3%38.0%50.6%11.1%45.4%86.1%56.6%79.7%-9.725.3%54.7%—79.8%$0.2356/s2.46s
61GPT 6 Sol↗mediumOpenAI39.8—41.0%53.8%24.6%——42.3%82.3%27.018.7%43.2%—80.4%$4.00——
62Gemini 3.8 Flash↗mediumGoogle39.893.5%42.1%55.1%12.3%45.8%83.9%46.1%84.0%28.619.7%48.1%—84.2%$1.50——
63Gemini 3.7 Flash↗mediumGoogle39.6估算92.1%39.0%59.8%9.4%35.5%78.3%43.0%83.0%23.7—34.1%—84.7%$1.50285/s6.62s
64Muse Spark 1.2↗xhighMeta39.690.4%45.5%57.4%17.7%34.8%80.1%48.9%79.0%27.27.1%66.7%——$2.00325/s12.05s
65DeepSeek V4.1 Flash↗maxDeepSeek39.5—39.2%51.9%14.3%——55.0%84.0%-5.326.8%3.5%—77.0%$0.52217/s1.16s
66Claude Opus 5↗lowAnthropic39.488.9%43.4%49.2%23.1%30.3%76.4%40.2%81.3%28.626.3%37.8%—79.8%$10.0051/s3.02s
67GPT 5.6 Sol↗mediumOpenAI39.292.6%42.2%57.4%22.9%36.5%86.1%46.1%80.3%19.414.6%9.2%69.6%81.4%$8.0073/s5.01s
68Gemini 3.7 Flash↗highGoogle39.194.5%47.9%57.2%14.3%32.8%85.8%44.6%81.7%26.513.6%35.5%—85.5%$1.50280/s9.68s
69GPT 5.4↗xhighOpenAI39.0估算92.0%43.7%—23.4%39.6%78.3%37.4%82.0%5.8—8.3%73.9%78.4%$5.6391/s154.53s
70Grok 4.5↗highSpaceXAI38.893.1%42.7%55.0%15.4%42.1%81.6%44.3%79.3%25.310.6%45.9%—80.4%$3.0052/s17.69s
71Mistral Large 4↗previewMistral38.4—35.0%54.2%10.6%——46.2%81.3%-5.326.8%58.1%—76.4%$2.06——
72GPT 5.5↗xhighOpenAI38.493.5%45.8%55.8%27.1%39.0%84.3%42.7%84.3%20.514.6%11.0%75.9%79.9%$11.2588/s38.96s
73Claude Sonnet 5↗maxAnthropic38.291.1%41.3%54.3%16.9%37.3%80.5%48.3%82.0%16.414.1%60.6%—77.3%$4.0079/s204.05s
74GPT 6 Luna↗maxOpenAI38.1—38.5%54.6%19.4%——46.6%83.3%0.712.6%23.3%—79.7%$0.20139/s98.82s
75GPT 5.6 Terra↗xhighOpenAI38.090.8%41.9%52.3%27.1%29.7%80.1%47.5%79.0%-3.010.1%11.0%66.3%79.5%$4.5099/s33.33s
76MiMo V2.6 Flash↗Xiaomi37.9—35.1%51.3%12.0%——55.5%74.3%-12.722.7%45.6%—73.1%$0.1858/s3.37s
77Claude Haiku 5.5↗highAnthropic37.8—37.3%48.7%18.6%——45.9%77.3%5.821.7%55.5%——$0.20174/s22.65s
78GPT 5.6 Luna↗maxOpenAI37.391.1%39.5%53.6%20.6%31.1%80.9%48.2%83.7%-10.311.6%7.4%—78.6%$0.45113/s105.96s
79GPT 5.5↗highOpenAI37.093.2%45.0%56.1%25.4%36.7%79.4%41.3%84.3%18.89.1%10.9%71.6%81.1%$11.2581/s27.80s
80Gemini 3.7 Flash↗lowGoogle36.9估算90.1%35.1%55.7%5.7%29.5%79.8%41.4%78.7%22.1—32.3%—84.9%$1.50292/s1.29s
81DeepSeek V4 Pro↗0813 · maxDeepSeek36.092.8%41.0%51.0%18.0%39.6%78.7%47.5%80.3%0.814.1%5.2%——$1.9889/s1.59s
82Claude Sonnet 5.5↗Default · lowAnthropic35.9—36.2%49.1%11.4%——33.9%76.0%19.420.7%49.8%——$4.00100/s0.88s
83Grok 4.6↗lowSpaceXAI35.187.9%27.6%49.4%5.7%38.1%75.3%45.5%80.7%25.93.0%69.4%——$3.0057/s7.86s
84DeepSeek V4 Flash Vision↗maxDeepSeek34.891.3%34.5%49.7%10.9%41.0%74.2%52.3%81.3%-17.612.1%8.5%—74.8%$0.66221/s1.10s
85GPT 6 Luna↗xhighOpenAI34.6—34.3%51.7%17.4%——43.2%80.0%-1.88.1%17.6%—79.7%$0.20116/s23.59s
86GPT 5.6 Luna↗xhighOpenAI34.689.5%37.0%50.5%20.6%28.7%77.9%45.0%81.7%-10.83.5%7.5%—78.6%$0.45111/s52.86s
87Claude Haiku 5.5↗mediumAnthropic34.5—33.8%49.0%12.9%——38.7%77.3%4.515.2%55.2%——$0.20166/s13.40s
88Claude Sonnet 5↗xhighAnthropic34.4—39.0%54.1%15.4%——43.1%76.7%3.27.1%41.4%——$4.0064/s26.87s
89DeepSeek V4 Flash↗0731 · maxDeepSeek34.390.8%38.6%50.3%16.6%39.4%78.7%46.9%79.7%-14.312.1%8.3%——$0.66222/s0.89s
90GLM 5.3↗lowZ AI34.3—36.6%42.0%14.6%——41.1%72.7%-8.434.8%36.0%——$2.1575/s3.22s
91GPT 5.6 Terra↗highOpenAI34.289.6%38.5%52.4%22.9%28.7%75.7%43.8%77.7%-3.51.5%10.2%64.4%79.1%$4.50103/s4.81s
92GPT 6 Sol↗lowOpenAI34.2—34.9%50.2%16.3%——35.2%79.3%26.59.1%49.3%—80.2%$4.0090/s1.71s
93Gemini 3.6 Flash↗highGoogle34.092.8%40.8%53.4%10.6%29.9%77.5%39.2%80.0%22.17.1%44.4%—83.2%$1.50197/s13.66s
94JT 4.1 Flash↗236B A21B · onChina Mobile33.9—43.6%52.0%14.0%——41.2%78.3%20.63.0%43.0%—————
95GPT 5.5↗mediumOpenAI33.892.6%42.4%54.5%18.6%29.9%80.5%36.5%83.0%18.15.1%10.4%71.0%81.2%$11.2584/s7.61s
96Muse Spark 1.1↗xhighMeta33.789.8%46.2%58.8%15.1%31.8%77.9%35.7%77.7%28.16.1%50.0%——$2.0093/s64.90s
97GLM 5.2↗maxZ AI33.789.5%41.1%51.2%20.9%34.6%77.9%43.7%78.3%4.41.0%73.7%73.3%—$2.1582/s3.84s
98Qwen 3.8↗27B · xhighAlibaba33.790.5%33.9%46.6%5.4%48.0%79.8%46.0%82.0%-10.05.6%69.7%—76.3%$1.1346/s3.85s
99Gemini 3.5 Flash↗mediumGoogle33.6估算92.1%41.3%—10.9%———74.3%20.8—38.2%74.6%83.9%$3.38206/s13.58s
100Motif 3↗Motif Technologies33.6估算83.4%37.0%42.2%6.6%35.3%74.9%31.1%76.0%10.2—71.6%—————

每一列測的是什麼

Artificial Analysis Intelligence Index
越高越好
GPQA Diamond
越高越好
Humanity's Last Exam
越高越好 · 推理與知識
SciCode
越高越好 · 程式設計
CritPt
越高越好 · 推理與知識
τ³-Banking
越高越好
Terminal-Bench 2.1
越高越好
GDPval-AA
越高越好 · 代理式工作
AA-LCR
越高越好 · 長上下文
AA-Omniscience Index
越高越好 · 事實性
Terminal-Bench 4.0
越高越好 · 代理式程式設計
AA-Omniscience Non-Hallucination Rate
越高越好 · 事實性
IFBench
越高越好
MMMU-Pro
越高越好 · 多模態
Blended Price, USD per 1M tokens (3:1 input:output)
越低越好 · 成本
Output Speed
越高越好 · 速度
Time To First Token
越低越好 · 速度