看大模型的「价格—得分」散点图,人人都在做同一件事:眯着眼找左上方那几个点,其余的一概略过。斩杀线替你把这一眼看完,每次都用同一把尺子,答案直接画在图上。
斩杀者
先立一条规则:如果模型 A 至少一样便宜,又至少一样强——同样的价钱分更高,或者同样的分数更便宜——就说 A 斩杀了 B。把榜上每个模型斩杀的数量数一遍,斩得最多的那个就是斩杀者。平手时取更便宜的,再平取更强的。
斩杀者不是最强的模型,也不是最便宜的。它标出的是一个价位:过了这个价,多花的钱在这张榜上不再换来更高的分。在多数榜上,它都不是人们看图之前会想到的那个模型。
一个十字,三个区域
在斩杀者的价格处画一条竖线,在它的得分处画一条横线,这个十字就是斩杀线。榜上每个模型都恰好落进三块之一:
- SOTA,横线以上:得分高过斩杀者。它可能贵得多,斩杀线不因此扣它的分。过了斩杀者这个价位,多花的钱唯一还能买到的,就是更高的分数。
- 低成本,左下方:更便宜,也更弱。这是取舍,不是失误,预算说了算的时候就选它。
- 被斩杀,右下方:价格不低于斩杀者,得分却不比它高。选它,就是多花钱买斩杀者已经给得起的东西。
剩下那个角注定是空的。一个比斩杀者更便宜又更强的当前模型,能斩杀斩杀者斩杀的全部,外加斩杀者本身,那它才该是斩杀者。
首页画的是综合榜的斩杀线。编程和智能体两个场景各画各的,用的是该场景最倚重的那项基准,所以写代码最划算的模型,不一定是综合最划算的那个。
这条线不做的事
两个轴来自同一个数据源。价格和得分由同一家机构发布、用同一种方式测量。把一个榜的价格和另一个榜的分数拼在一起,画出来的点没有人真正测过;所以不公布价格的榜只排名次,不画斩杀线。
每次刷新都重算。斩杀者易主,可能因为新模型发布,也可能只因为一次调价:某个模型每百万 token 的价格翻了四倍,十字就会挪动,换另一个模型接手。我们不为了让线看起来稳定而做平滑;每张榜都写明数据来源和抓取时间,任何一次变动都能追溯。
上一代模型不参与画线。数据源已不再列为当前的模型,会被放到十字上定位,但不能当斩杀者,不计入斩杀数,也不计入任何一档的统计。斩杀线只在数据源仍在跟踪的模型之间画:移出当前列表的模型也许还在卖,但已经不是这张榜拿来衡量全场的那一批。
它没告诉你的
斩杀线只看价格和一项测出来的能力,别的一概不管。被斩杀的模型仍可能是你的正确选择:权重开放、可以自行部署,上下文窗口更长,许可协议能过法务这一关,延迟满足要求。它说的只是:按这个数据源的测量,就这一项能力而言,你多付的钱买的不是分数。
图上那条浅色折线连起的,是没有哪个模型能在价格和得分上同时胜过的模型,叫作前沿。它回答的是另一个问题:「我这点预算,最好能买到什么」。它在点与点之间连线,所以从斜线上读出的分数落在两个模型之间,并不对应任何一个真能买到的模型。
接着看
- 家族榜和厂商榜:同一张榜,按产品线或公司折叠,各由最强的一款出战。
- Harness 榜:Claude Code、Codex、Pi 等编程智能体工具,按各自最好的一组成绩排名,写明每任务花费。
- 术语表解释其余的词,OnlySOTA 如何读一份榜单讲每个数字从哪里来。