研究者らは、大規模言語モデルの競技レベルのコーディング能力を評価するために設計された標準化されたベンチマークであるCodeEloを発表した。これは公式のCodeForcesプラットフォームに準拠することで、既存のツールの限界に対処し、実際のコンテスト問題の使用、特別ジャッジのサポート、人間参加者と同等のエロレーティングシステムの提供を行っている。
- CodeEloは、部門、難易度評価、アルゴリズムタグの詳細を含む最近のCodeForcesコンテスト問題を統合している。
- 問題は判定のためにプラットフォームに直接送信され、実行環境の整合性を確保する。
- この研究では、30のオープンソースおよび3つのプロプライエタリなLLMのエロレーティングを初めて提供している。
- 結果は、o1-mini (1578) と QwQ-32B-Preview (1261) が他のモデルを大幅に上回り、それらのモデルが最も簡単な問題でさえ苦戦していることを示している。
このベンチマークは、洗練されたコード推論能力を評価するための信頼性の高い方法を提供し、異なるアルゴリズムやプログラミング言語にわたるモデルのパフォーマンスに関する洞察を提供する。