ベンチマーク · general

LMSYS Arena (Elo)

23 結果 21 モデル

LMSYS Chatbot Arena は、実際の人間が匿名の2つのモデルを並べて比較することで、AIチャットボットの自由な対話の上手さを測ります。結果は Elo レーティング(チェスで使われる相対的な強さの数値、おおよそ 1000-1500+)に集約されます。

詳しく見る
訪問者が自由形式のプロンプト(例:「量子もつれを10歳の子どもに説明して」や「連結リストを反転する Python 関数を書いて」)を入力し、隠された2つのモデルの回答を見て、より良い方を選びます。
採点方法
各ブラインド投票は1対1の勝ち/負け/引き分けであり、多数のユーザーの投票を集約して Elo スコアに変換します。数値が高いほど、そのモデルが対戦で多く勝っていることを意味します。
検証方法
自動テストや模範解答はなく、結果はクラウドソーシングされた人間の好みの投票のみで決まります。ブランド名が選択に影響しないよう、投票はブラインドで行われます。
重要な理由
固定されたテストセットではなく、日常的なプロンプトに対する実ユーザーの主観的な判断を反映するため、チャットボット全体の品質を測る、広く注目され不正操作しにくいリーダーボードとなっています。
解説付きの例
課題
Chatbot Arena のプロンプト(自由回答、2 モデルを並べて比較):「好奇心旺盛な 10 歳の子どもに、簡単なたとえを使って TCP と UDP の違いを説明し、それぞれに依存する日常的なアプリを 1 つずつ挙げてください」。匿名の 2 つのモデルが同じプロンプトに回答し、あなたがより良い回答に投票します。
解答
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
解説
この回答が良いとされるのは、技術的に正確で(TCP = 信頼性が高く順序どおり、UDP = 高速でベストエフォート)、年齢に合ったたとえを 1 つ使い、求められた両方の部分(それぞれに 1 つのアプリ)を満たしているからです。採点方法:正解ラベルは存在せず、匿名の 2 モデルが同じプロンプトに回答し、人間がより良い方を選び、対戦ごとの投票を Elo/Bradley-Terry のリーダーボードに集約します。
1000 1250 1500 1750 2000 2024-03-27 2025-05-25 2026-07-24 Bard (Gemini Pro) · 1203 · 2024-03-27 GPT-4 preview models · 1251 · 2024-03-27 GPT-4–0314 · 1185 · 2024-03-27 Claude 3 Sonnet · 1198 · 2024-03-27 Qwen1.5–72B-Chat · 1148 · 2024-03-27 Mistral-Large-2402 · 1157 · 2024-03-27 Claude 3 Opus · 1253 · 2024-03-27 GPT-4o · 1309 · 2024-05-15 Gemini 1.5 Pro 0801 · 1300 · 2024-08-02 Gemini-Exp-1114 · 1344 · 2024-11-15 Gemini-Exp-1206 · 1379 · 2024-12-09 Grok-3 · 1402 · 2025-02-18 Grok 3 · 1402 · 2025-02-19 Gemini 2.5 Pro · 1415 · 2025-05-20 Gemini 2.5 Pro · 1470 · 2025-06-05 Gemini 2.5 06-05 · 1470 · 2025-06-05 Grok4.1 (Thinking) · 1510 · 2025-11-17 Gemini 3 Pro · 1501 · 2025-11-18 Gemini 3 Pro · 1501 · 2025-11-18 Claude Opus 4.6 · 1606 · 2026-02-05 Kimi K3 · 1679 · 2026-07-24 Claude Fable 5 · 1760 · 2026-07-24 GPT-5.6 Sol · 1743 · 2026-07-24
Bard (Gemini Pro) GPT-4 preview models GPT-4–0314 Claude 3 Sonnet Qwen1.5–72B-Chat Mistral-Large-2402 Claude 3 Opus GPT-4o Gemini 1.5 Pro 0801 Gemini-Exp-1114 Gemini-Exp-1206 Grok-3 Grok 3 Gemini 2.5 Pro Gemini 2.5 06-05 Grok4.1 (Thinking) Gemini 3 Pro Claude Opus 4.6 Kimi K3 Claude Fable 5 GPT-5.6 Sol
タイムライン
日付 モデル スコア ソース
2026-07-24 Kimi K3 1679.0Elo Kimi K3が最大級のオープンウェイトモデルとして登場;Muse Spark 1.1リリース
2026-07-24 Claude Fable 5 1760.0Elo Kimi K3が最大級のオープンウェイトモデルとして登場;Muse Spark 1.1リリース
2026-07-24 GPT-5.6 Sol 1743.0Elo Kimi K3が最大級のオープンウェイトモデルとして登場;Muse Spark 1.1リリース
2026-02-05 Claude Opus 4.6 1606.0Elo Anthropicが1Mコンテキストウィンドウとエージェント機能の改善を備えたClaude Opus 4.6をリリース
2025-11-18 Gemini 3 Pro 1501.0Elo Google、最先端の推論とマルチモーダル機能を備えたGemini 3 Proをリリース
2025-11-18 Gemini 3 Pro 1501.0Elo GoogleがGemini 3 Proをリリース、最先端の推論とマルチモーダル能力を搭載
2025-11-17 Grok4.1 (Thinking) 1510.0Elo xAIがGrok 4.1をリリース、幻覚を減少させLMArenaリーダーボードで首位を獲得
2025-06-05 Gemini 2.5 06-05 1470.0Elo Google、コーディングと推論の強化されたGemini 2.5 06-05プレビューをリリース
2025-06-05 Gemini 2.5 Pro 1470.0Elo Google、コード記述と推論を改善した Gemini 2.5 Pro のアップグレード版プレビューを発表
2025-05-20 Gemini 2.5 Pro 1415.0Elo Google DeepMind、Deep Think、音声出力、コンピュータ操作機能を搭載したGemini 2.5を更新
2025-02-19 Grok 3 1402.0Elo xAIがGrok 3 BetaとDeepSearchエージェントをリリース
2025-02-18 Grok-3 1402.0Elo xAIのGrok-3がChatbot Arenaで1400点を突破する初のモデルとなる
2024-12-09 Gemini-Exp-1206 1379.0Elo GoogleのGemini-Exp-1206がLMArenaリーダーボードでChatGPTを凌駕
2024-11-15 Gemini-Exp-1114 1344.0Elo GoogleのGemini-Exp-1114がChatbot Arenaで共同1位にランクイン
2024-08-02 Gemini 1.5 Pro 0801 1300.0Elo Googleの実験的Gemini 1.5 Pro 0801がLMSYS Chatbot ArenaでGPT-4oを上回る
2024-05-15 GPT-4o 1309.0Elo OpenAIはChatbot ArenaでGPT-4oを密かにテストし、リーダーボードのトップに
2024-03-27 Bard (Gemini Pro) 1203.0Elo LMSYSベンチマークでClaude 3 OpusがElo評価1253でトップランク
2024-03-27 GPT-4 preview models 1251.0Elo LMSYSベンチマークでClaude 3 OpusがElo評価1253でトップランク
2024-03-27 GPT-4–0314 1185.0Elo LMSYSベンチマークでClaude 3 OpusがElo評価1253でトップランク
2024-03-27 Claude 3 Sonnet 1198.0Elo LMSYSベンチマークでClaude 3 OpusがElo評価1253でトップランク
2024-03-27 Qwen1.5–72B-Chat 1148.0Elo LMSYSベンチマークでClaude 3 OpusがElo評価1253でトップランク
2024-03-27 Mistral-Large-2402 1157.0Elo LMSYSベンチマークでClaude 3 OpusがElo評価1253でトップランク
2024-03-27 Claude 3 Opus 1253.0Elo LMSYSベンチマークでClaude 3 OpusがElo評価1253でトップランク