SevenTnewS

基准分析

500万次投票,25个Elo分:深入解读无人能撼动的Chatbot Arena排行榜

LMSYS Chatbot Arena通过盲评人类偏好,以Elo量表对模型进行排名,目前近500万张选票将顶级实验室压缩在一个25分区间内。LLM-as-a-Judge方法虽然能扩展此类评估的规模,但其自身存在已记录在案的对冗长和顺序的偏见。

Emmanuel Fabrice Omgbwa Yasse

2026-08-02 · 阅读需 2 分钟

500万次投票,25个Elo分:深入解读无人能撼动的Chatbot Arena排行榜
来源 : Évaluation et B…·LMSYS Chatbot A…·Chatbot Arena: …

Chatbot Arena(网站为lmarena.ai)反复提出一个简单问题:面对同一提示词的两个匿名模型回复,您更喜欢哪一个?没有评分,没有标准,只有投票。这些投票进入Elo评分系统,这套数学方法与国际象棋棋手排名所用的相同,击败强手比击败弱手获得更多分数,而每一次结果都会轻微调整两个模型的评分。

这种设置吸引人之处在于它衡量了闭卷考试无法衡量的东西:人们是否真正喜欢使用这个模型。一个系统可能在GPQA Diamond上取得满分,但其回复在实际用户看来却显得生硬、回避或格式糟糕。Arena直接、大规模且匿名地捕捉偏好,这很难伪造,而且通过其他方式复制的成本很高。

几乎没有差距的排行榜顶部

在记录近500万张选票后,当前各实验室的排名非常接近:Anthropic 1503 Elo分,xAI 1495分,Google 1494分,OpenAI 1481分,Alibaba 1449分,DeepSeek 1424分。整个顶级梯队被压缩在一个25分的区间内,这个差距很小,以至于投票样本的适度变化就可能重新排序。在这种聚集之下,有两个更广泛的模式:封闭的专有模型相比开放权重模型拥有约3.3%的优势,而中美最强大实验室之间的平均差距已缩小至约2.7%。这两个差距都不是那种任何人都能期待长期保持的领先优势。

评判背后的评判

人工投票无法扩展到实验室想要测试的每一个提示词变体,因此大多数生产环境评估流程依赖第二种方法:LLM-as-a-Judge(大模型作为评判),即由前沿模型按照结构化标准对其他模型的输出进行评分,而非人工操作。这种方法快速且廉价, , 基于评判的评估成本比聘请人工评估员便宜500到5000倍,并且与人类判断的一致性达到80%到90%。对于大多数日常评估工作,这已经足够完全取代人工评审团队。

然而,那10%到20%的不一致并非随机噪声。它们集中在特定的、有记录可查的偏见上。评判模型会系统性地奖励更长、更精心构建的答案,无论额外的长度是否增加了信息,研究人员称之为冗长偏见(verbosity bias)。它们还倾向于偏爱比较中先显示的答案,并对任何迎合评判自身提示框架的回应给予更有利的评分,这是一种难以完全通过训练消除的位置偏见和谄媚偏见的混合。

这对解读排行榜意味着什么

Arena的Elo排名和基于评判的分数确实有用,它们衡量了闭卷、单答案的基准测试在结构上无法衡量的东西:模型在人们与之进行的混乱、开放式交流中的表现。但是,两个实验室之间20个Elo分的差距,或者在LLM评判的评估中险胜,更接近于带轻微偏向的抛硬币结果,而非确定性的排名。对待Chatbot Arena的顶部排名,就像对待一张难分伯仲的冲线照片:有趣、有信息量,但不值得押注其永久性。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。