OnlySOTA

读懂这些榜单的术语表

SOTA、Elo、斩杀者、变体、检查点、混合价格——榜单上的这些词各指什么,实际衡量的又是什么。

榜单上的词有三个来源:这个领域通用的说法、各家数据源的叫法,以及本站自己定义的概念。分清来源很重要,因为只有第三类由我们来下定义。

SOTA

State of the art,当前最佳。在本站,它不是一句褒奖,而是一个位置:模型位于斩杀者的十字之上,也就是得分高于那个斩杀同类最多的模型,它就是 SOTA,与价格无关。

基准(Benchmark)

一项已发布的测量,名称沿用发布者的叫法。基准属于实际跑它的那一方:同名基准由两家机构分别跑出,在本站算作两项,因为测试框架、提示词和判分方式都是这个数字的一部分。

能力(Capability)

多项基准共同反映的一个维度,比如编程、智能体工作、成本。能力页把相关基准并排列出,但不合并,所以它回答的是「各数据源在这个维度上分歧在哪」,而不是「综合得分是多少」。

场景(Board)

访客带着来的那个问题,比如「这类工作该用哪个模型」,由所有能回答它的数据源共同作答。场景还会再分出几个小节,对应这个领域真正存在的子问题:比模型还是比框架,看自动评分的编程成绩还是看人工偏好的编程成绩。

Elo

一种来自两两比较的评分:给人看两个回答,让人选出更好的一个。Elo 没有零点,它的起点只是一个任意设定的锚点,并不代表「毫无能力」。所以本站从不把 Elo 画成从左边缘长出的条形:有意义的是两行之间的距离,而不是到左边缘的距离。

斩杀线与斩杀者

斩杀者是斩杀同类最多的模型,「斩杀」指至少一样便宜、且至少一样强。斩杀线是以它为中心的十字,把榜单分成 SOTA、低成本和被斩杀三块。两个轴必须来自同一个数据源:拿一个源的价格去配另一个源的分数,画出来的是一条没有人测过的线。完整讲解见斩杀线。

图上那条更浅的折线连起的,是没有哪个模型能在价格和得分上同时胜过的模型,叫作前沿。它在点与点之间连线,所以从斜线上读出的分数落在两个模型之间,并不对应任何一个真能买到的模型。

变体(Variant)

运行配置,与模型本身相区分。推理强度、测试框架、上下文窗口、服务商、规模、发布阶段、带日期的构建,都是同一个模型上的设置,而不是另一个模型。哪些词算作设置,由一份封闭、逐条人工核对的清单决定,因为 Max 在一家厂商那里是设置,在另一家那里却是型号名称的一部分。

检查点(Checkpoint)

带日期的构建,例如 20260813。检查点只是同一模型下的一个档位,而不是一个新模型,所以永远不会有自己的 id。

产品线(Line / Family)

模型所属的系列,由人工声明,而不是从名字里解析出来。Claude Opus 是一条产品线,涵盖 Opus 3 到 Opus 5;GPT 5.6 带有版本号,所以不算产品线,而是其下若干模型的一个分组。靠名字推导行不通:两个 id 的最长公共前缀会把一条产品线按版本拆开,而改名之前的 id(比如 claude-4-opus)与它所属的产品线根本没有共同前缀。

混合价格(Blended price)

按固定比例混合输入和输出价格后得到的每百万 token 单价,由数据源自行公布。它是用来横向比较的费率,不是报价:本站的任何价格都不构成要约,实际账单取决于你自己的用量结构。

未识别(Unmatched)

上游的某一行,名称暂时对应不到本站收录的任何模型。它会照常显示、加上标记,并留在原始榜单上。它不出现在跨榜视图中只有一个原因:在有人确认它究竟是哪个模型之前,无法把它和其他榜对应起来。

上一代(Legacy)

发布它的数据源已不再把它列为当前模型。这是数据源的判断,不是厂商的:上一代模型可能仍在提供服务。它保留在榜上并加上标记,成绩取仍列为当前的最好配置,不出现在价格图和斩杀线上。这个标记按配置计算:同一个模型的高强度档位可能已是上一代,而另一个档位仍是当前的。

估算(Estimated)

数据源标明为推算、而非实测的数字。本站原样保留这个标记并显示出来,即使它落在斩杀线上最关键的那个点上。