ベンチマーク · coding

Codeforces (Elo)

10 結果 10 モデル

Codeforces (Elo) は、時間制限のあるコンテスト問題を解かせることでモデルの競技プログラミング能力を測り、その結果を Codeforces の Elo レーティング(おおよそ 0〜4000、約 2000 以上で強豪)として表します。

詳しく見る
典型的な問題は時間制限のあるアルゴリズム問題です。たとえば、問題の入力を読み取り、厳しい時間・メモリ制限の中で正しい答えを出力するもので、グラフ探索・動的計画法・貪欲法などの手法を使います。
採点方法
結果は 1 つの Elo 数値で、モデルが解いたコンテスト問題の数とその難易度から計算され、Codeforces が人間の競技者に用いるのと同じレーティング尺度上に置かれます。
検証方法
提出された各解答は自動で判定されます。コードはコンパイルされ、隠された一連のテストケースに対して実行され、時間・メモリ制限内で正しい出力を返した場合にのみ「正解」と見なされます。
重要な理由
多段階のアルゴリズム的推論と、制約の中で正しく効率的なコードを書く能力を反映し、モデルのコーディング力を人々がすでに理解しているレーティング尺度に対応づけます。
解説付きの例
課題
Watermelon:整数 w(1 ≤ w ≤ 100)がスイカの重さとして与えられる。各部分が正の偶数キログラムになるように 2 つに分けられるか判定し、「YES」または「NO」を出力せよ。
解答
w = int(input())
print("YES" if w > 2 and w % 2 == 0 else "NO")
解説
2 つの正の偶数の和は偶数で 4 以上になるため、w が偶数かつ w > 2 のときに限り有効な分割が存在する(例:w=8 → 2+6)。Codeforces は提出をコンパイルして隠しテストケースで実行し、時間・メモリ制限内で stdout の出力が期待値と完全一致することを求めて採点する。
88 1016 1944 2872 3800 2024-09-12 2025-08-14 2026-07-16 o1 · 1807 · 2024-09-12 OpenAI o1-preview · 89 · 2024-10-01 o3 · 2727 · 2024-12-20 QwQ-32B-Preview · 1261 · 2025-01-02 o1-mini · 1578 · 2025-01-02 DeepSeek-R1 · 2029 · 2025-01-22 o4-mini · 2719 · 2025-04-17 Qwen3-235B-A22B · 2056 · 2025-05-14 Gemini 3 Deep Think · 3455 · 2026-02-12 GFlowRL · 2048 · 2026-07-16
o1 OpenAI o1-preview o3 QwQ-32B-Preview o1-mini DeepSeek-R1 o4-mini Qwen3-235B-A22B Gemini 3 Deep Think GFlowRL
タイムライン
日付 モデル スコア ソース
2026-07-16 GFlowRL 2048.0Elo Microsoft、大規模言語モデル向けの安定したGFlowNetスタイルの強化学習「GFlowRL」をリリース
2026-02-12 Gemini 3 Deep Think 3455.0Elo Google、新しいベンチマークスコアを持つGemini 3 Deep Thinkをリリース
2025-05-14 Qwen3-235B-A22B 2056.0Elo Qwen3が統一思考モードと119言語対応を導入
2025-04-17 o4-mini 2719.0Elo OpenAIが高速で低コストなマルチモーダル推論モデルo4-miniをリリース
2025-01-22 DeepSeek-R1 2029.0Elo DeepSeek、強化学習によるR1推論モデルをリリース
2025-01-02 QwQ-32B-Preview 1261.0Elo CodeEloが人間と同等のエロレーティングを備えた競技レベルのコード生成ベンチマークを導入
2025-01-02 o1-mini 1578.0Elo CodeEloが人間と同等のエロレーティングを備えた競技レベルのコード生成ベンチマークを導入
2024-12-20 o3 2727.0Elo OpenAI、推論とコーディングで高性能なモデルo3をリリース
2024-10-01 OpenAI o1-preview 89.0Elo OpenAI o1と他の主要モデルの比較
2024-09-12 o1 1807.0Elo OpenAIが数学・科学ベンチマークで人間の専門家を上回る推論モデルo1-previewをリリース