Benchmark · general

LMSYS Arena (Elo)

23 条结果 21 个模型

LMSYS Chatbot Arena 通过让真实用户并排比较两个匿名模型,来衡量 AI 聊天机器人进行开放式对话的能力。结果汇总为 Elo 评分,也就是国际象棋中使用的那种相对实力数值(大约 1000-1500+)。

了解更多
示例
访客输入一个自由形式的提示——比如「向 10 岁孩子解释量子纠缠」或「写一个反转链表的 Python 函数」——看到两个隐藏模型作答,然后选出更好的回复。
评分方式
每次盲投都是一次两两之间的胜/负/平;这些来自众多用户的投票被汇集起来并换算成 Elo 分数,分数越高表示该模型在对阵中胜出的次数越多。
验证方式
这里没有自动化测试或参考答案——结果完全由众包的人类偏好投票决定,且以盲选方式进行,使品牌名称无法影响选择。
为何重要
因为它反映的是真实用户在日常提示上的主观判断,而非固定的测试集,所以它是一个备受关注、难以刷分的聊天机器人综合质量排行榜。
示例解析
任务
Chatbot Arena 提示词(开放式,两个模型并排比较):「用一个简单的类比向一个好奇的 10 岁孩子解释 TCP 和 UDP 的区别,然后各说出一个依赖它们的日常应用。」两个匿名模型回答同一个提示词,由你投票选出更好的回答。
解答
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
解析
这个回答被判为好,因为它在技术上准确(TCP = 可靠且有序,UDP = 快速、尽力而为),使用了一个适合该年龄的类比,并覆盖了要求的两个部分(各举一个应用)。评分方式:没有标准答案——两个匿名模型回答同一个提示词,由人来选出更好的回答,成对投票汇总成 Elo/Bradley-Terry 排行榜。
1000 1250 1500 1750 2000 2024-03-27 2025-05-25 2026-07-24 Bard (Gemini Pro) · 1203 · 2024-03-27 GPT-4 preview models · 1251 · 2024-03-27 GPT-4–0314 · 1185 · 2024-03-27 Claude 3 Sonnet · 1198 · 2024-03-27 Qwen1.5–72B-Chat · 1148 · 2024-03-27 Mistral-Large-2402 · 1157 · 2024-03-27 Claude 3 Opus · 1253 · 2024-03-27 GPT-4o · 1309 · 2024-05-15 Gemini 1.5 Pro 0801 · 1300 · 2024-08-02 Gemini-Exp-1114 · 1344 · 2024-11-15 Gemini-Exp-1206 · 1379 · 2024-12-09 Grok-3 · 1402 · 2025-02-18 Grok 3 · 1402 · 2025-02-19 Gemini 2.5 Pro · 1415 · 2025-05-20 Gemini 2.5 Pro · 1470 · 2025-06-05 Gemini 2.5 06-05 · 1470 · 2025-06-05 Grok4.1 (Thinking) · 1510 · 2025-11-17 Gemini 3 Pro · 1501 · 2025-11-18 Gemini 3 Pro · 1501 · 2025-11-18 Claude Opus 4.6 · 1606 · 2026-02-05 Kimi K3 · 1679 · 2026-07-24 Claude Fable 5 · 1760 · 2026-07-24 GPT-5.6 Sol · 1743 · 2026-07-24
Bard (Gemini Pro) GPT-4 preview models GPT-4–0314 Claude 3 Sonnet Qwen1.5–72B-Chat Mistral-Large-2402 Claude 3 Opus GPT-4o Gemini 1.5 Pro 0801 Gemini-Exp-1114 Gemini-Exp-1206 Grok-3 Grok 3 Gemini 2.5 Pro Gemini 2.5 06-05 Grok4.1 (Thinking) Gemini 3 Pro Claude Opus 4.6 Kimi K3 Claude Fable 5 GPT-5.6 Sol
时间线
日期 模型 得分 来源
2026-07-24 Kimi K3 1679.0Elo Kimi K3 作为最大开源权重模型发布;Muse Spark 1.1 发布
2026-07-24 Claude Fable 5 1760.0Elo Kimi K3 作为最大开源权重模型发布;Muse Spark 1.1 发布
2026-07-24 GPT-5.6 Sol 1743.0Elo Kimi K3 作为最大开源权重模型发布;Muse Spark 1.1 发布
2026-02-05 Claude Opus 4.6 1606.0Elo Anthropic 发布 Claude Opus 4.6,具备 1M 上下文窗口和智能体改进
2025-11-18 Gemini 3 Pro 1501.0Elo Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-18 Gemini 3 Pro 1501.0Elo Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-17 Grok4.1 (Thinking) 1510.0Elo xAI发布Grok 4.1,以幻觉减少的成绩登顶LMArena排行榜
2025-06-05 Gemini 2.5 06-05 1470.0Elo Google 发布 Gemini 2.5 06-05 预览版,带来编码与推理能力升级
2025-06-05 Gemini 2.5 Pro 1470.0Elo Google 推出升级版的 Gemini 2.5 Pro 预览版,编码和推理能力得到增强
2025-05-20 Gemini 2.5 Pro 1415.0Elo Google DeepMind 更新 Gemini 2.5,引入深度思考、音频输出和计算机操作功能
2025-02-19 Grok 3 1402.0Elo xAI发布Grok 3 Beta版和DeepSearch智能体
2025-02-18 Grok-3 1402.0Elo xAI的Grok-3成为首个在Chatbot Arena中得分超过1400的模型
2024-12-09 Gemini-Exp-1206 1379.0Elo Google的Gemini-Exp-1206在LMArena排行榜上超越ChatGPT
2024-11-15 Gemini-Exp-1114 1344.0Elo Google的Gemini-Exp-1114在Chatbot Arena上并列第一
2024-08-02 Gemini 1.5 Pro 0801 1300.0Elo Google的实验性Gemini 1.5 Pro 0801在LMSYS Chatbot Arena上超越GPT-4o
2024-05-15 GPT-4o 1309.0Elo OpenAI在Chatbot Arena秘密测试GPT-4o,登顶排行榜
2024-03-27 Bard (Gemini Pro) 1203.0Elo LMSYS基准测试以1253的Elo评分将Claude 3 Opus列为榜首
2024-03-27 GPT-4 preview models 1251.0Elo LMSYS基准测试以1253的Elo评分将Claude 3 Opus列为榜首
2024-03-27 GPT-4–0314 1185.0Elo LMSYS基准测试以1253的Elo评分将Claude 3 Opus列为榜首
2024-03-27 Claude 3 Sonnet 1198.0Elo LMSYS基准测试以1253的Elo评分将Claude 3 Opus列为榜首
2024-03-27 Qwen1.5–72B-Chat 1148.0Elo LMSYS基准测试以1253的Elo评分将Claude 3 Opus列为榜首
2024-03-27 Mistral-Large-2402 1157.0Elo LMSYS基准测试以1253的Elo评分将Claude 3 Opus列为榜首
2024-03-27 Claude 3 Opus 1253.0Elo LMSYS基准测试以1253的Elo评分将Claude 3 Opus列为榜首