Benchmark · general
LMSYS Arena (Elo)
LMSYS Chatbot Arena 通过让真实用户并排比较两个匿名模型,来衡量 AI 聊天机器人进行开放式对话的能力。结果汇总为 Elo 评分,也就是国际象棋中使用的那种相对实力数值(大约 1000-1500+)。
了解更多
- 示例
- 访客输入一个自由形式的提示——比如「向 10 岁孩子解释量子纠缠」或「写一个反转链表的 Python 函数」——看到两个隐藏模型作答,然后选出更好的回复。
- 评分方式
- 每次盲投都是一次两两之间的胜/负/平;这些来自众多用户的投票被汇集起来并换算成 Elo 分数,分数越高表示该模型在对阵中胜出的次数越多。
- 验证方式
- 这里没有自动化测试或参考答案——结果完全由众包的人类偏好投票决定,且以盲选方式进行,使品牌名称无法影响选择。
- 为何重要
- 因为它反映的是真实用户在日常提示上的主观判断,而非固定的测试集,所以它是一个备受关注、难以刷分的聊天机器人综合质量排行榜。
示例解析
任务
Chatbot Arena 提示词(开放式,两个模型并排比较):「用一个简单的类比向一个好奇的 10 岁孩子解释 TCP 和 UDP 的区别,然后各说出一个依赖它们的日常应用。」两个匿名模型回答同一个提示词,由你投票选出更好的回答。
解答
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
解析
这个回答被判为好,因为它在技术上准确(TCP = 可靠且有序,UDP = 快速、尽力而为),使用了一个适合该年龄的类比,并覆盖了要求的两个部分(各举一个应用)。评分方式:没有标准答案——两个匿名模型回答同一个提示词,由人来选出更好的回答,成对投票汇总成 Elo/Bradley-Terry 排行榜。