综合偏好
真人在自己提出的问题上更喜欢哪个模型的回答,由两两投票汇总而成。它反映的是用户偏好,与能力相关但不等同;回答长度、排版和语气也会影响结果,所以这里采用排除了风格影响的分数。 按它在多少项基准里进入前 10 排序,一样多时看最好名次。每列保持各自的排名,不做平均。 「—」表示该榜没有收录这个模型,不是零分。尚未识别出具体模型的条目不在此处出现,但仍显示在各自的原始榜单上。
| 模型 | 进入前 10 | Arena — Text Overall (style control) |
|---|---|---|
| | 1/1 | #1 1525 |
| | 1/1 | #2 1507 |
| | 1/1 | #3 1504 |
| | 1/1 | #4 1504 |
| | 1/1 | #5 1501 |
| | 1/1 | #6 1501 |
| | 1/1 | #7 1497 |
| | 1/1 | #8 1494 |
| | 1/1 | #9 1492 |
| | 1/1 | #10 1491 |