LMSYSの研究者たちは、大規模言語モデルを比較するためにElo評価システムを使用したリーダーボードを公開し、AnthropicのClaude 3 Opusがトップの座を獲得したことを明らかにしました。このモデルは、人間の投票者によって評価された一騎打ちの結果に基づき、Elo評価1253を達成しました。

  • Claude 3 Opusは合計33,250票と+5/-5の記録で最高評価を維持しています。
  • OpenAIのGPT-4プレビューモデルが1251と1248の評価で続きます。
  • GoogleのBard (Gemini Pro)はElo評価1203で4位です。
  • 古いGPT-4–0314モデルは1185の評価で6位です。

このベンチマークは、言語AIの急速な進歩を追跡し、主要テクノロジー企業間の競争が激化する中で最先端のアーキテクチャを特定するための客観的な方法を提供します。