ベンチマーク · general
LMSYS Arena (Elo)
LMSYS Chatbot Arena は、実際の人間が匿名の2つのモデルを並べて比較することで、AIチャットボットの自由な対話の上手さを測ります。結果は Elo レーティング(チェスで使われる相対的な強さの数値、おおよそ 1000-1500+)に集約されます。
詳しく見る
- 例
- 訪問者が自由形式のプロンプト(例:「量子もつれを10歳の子どもに説明して」や「連結リストを反転する Python 関数を書いて」)を入力し、隠された2つのモデルの回答を見て、より良い方を選びます。
- 採点方法
- 各ブラインド投票は1対1の勝ち/負け/引き分けであり、多数のユーザーの投票を集約して Elo スコアに変換します。数値が高いほど、そのモデルが対戦で多く勝っていることを意味します。
- 検証方法
- 自動テストや模範解答はなく、結果はクラウドソーシングされた人間の好みの投票のみで決まります。ブランド名が選択に影響しないよう、投票はブラインドで行われます。
- 重要な理由
- 固定されたテストセットではなく、日常的なプロンプトに対する実ユーザーの主観的な判断を反映するため、チャットボット全体の品質を測る、広く注目され不正操作しにくいリーダーボードとなっています。
解説付きの例
課題
Chatbot Arena のプロンプト(自由回答、2 モデルを並べて比較):「好奇心旺盛な 10 歳の子どもに、簡単なたとえを使って TCP と UDP の違いを説明し、それぞれに依存する日常的なアプリを 1 つずつ挙げてください」。匿名の 2 つのモデルが同じプロンプトに回答し、あなたがより良い回答に投票します。
解答
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
解説
この回答が良いとされるのは、技術的に正確で(TCP = 信頼性が高く順序どおり、UDP = 高速でベストエフォート)、年齢に合ったたとえを 1 つ使い、求められた両方の部分(それぞれに 1 つのアプリ)を満たしているからです。採点方法:正解ラベルは存在せず、匿名の 2 モデルが同じプロンプトに回答し、人間がより良い方を選び、対戦ごとの投票を Elo/Bradley-Terry のリーダーボードに集約します。