ベンチマーク · math

AIME 2024

30 結果 27 モデル

AIME 2024 は、2024 年の American Invitational Mathematics Examination の 15 問を用いてモデルの高度な数学的推論を測定し、正解した割合を報告します。

詳しく見る
典型的な問題は高校レベルの難しい競技数学の問題で、たとえば整数論や組合せ論の問題であり、答えは 1 つの整数です(AIME の答えは常に整数で、通常 0 から 999 の範囲)。
採点方法
指標は正解率で、15 問中の正答の割合を表します。したがって 1 問正解ごとに全体の 1/15 の得点になります。
検証方法
結果は完全一致で判定されます。モデルの最終的な整数の答えが公式解答と一致する必要があり、自動でチェックされ、部分点も人手による採点もありません。
重要な理由
多段階の推論を要する難しく新しい競技問題の小さな集合であるため、最先端モデルの比較に広く使われ、問題が新しいことで学習データ汚染のリスクが下がります。
解説付きの例
課題
600 以下の正の整数 n のうち、4 または 6 で割り切れるが 5 では割り切れないものはいくつありますか?(AIME の解答は 0 から 999 までの整数です。)
解答
Multiples of 4 or 6 that are ≤ 600: 150 + 100 − 50 = 200. Of these, the ones also divisible by 5 (multiples of 20 or 30, minus 60): 30 + 20 − 10 = 40. Answer: 200 − 40 = 160.
解説
包除原理により 4 または 6 で割り切れる数は 200 個で、そのうち 40 個は 5 でも割り切れるため、残りは 160 個です。AIME は最終的な整数解(0–999)のみを自動採点し、部分点はありません。
0 25 50 75 100 2024-09-12 2025-08-09 2026-07-07 o1 · 13.9 · 2024-09-12 OpenAI o1-preview · 83 · 2024-10-01 QwQ-32B-Preview · 50 · 2024-11-28 o3 · 96.7 · 2024-12-20 o3 · 96.7 · 2026-03-25 DeepSeek-R1-Distill-Qwen-7B · 55.5 · 2025-01-22 DeepSeek-R1-Zero · 71 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 72.6 · 2025-01-22 DeepSeek-R1 · 79.8 · 2025-01-22 s1-32B · 57 · 2025-01-31 s1-32B · 57 · 2025-01-31 LIMO · 57.1 · 2025-02-05 Grok 3 mini · 95.8 · 2025-02-19 Claude 3.7 Sonnet · 80 · 2025-02-24 GPT-4.5 · 36.7 · 2025-03-05 DeepSeek-V3-0324 · 59.4 · 2025-03-24 Gemini 2.5 Pro · 92 · 2025-03-26 Seed1.5-Thinking · 86.7 · 2025-04-10 o4-mini · 93.4 · 2025-04-17 Qwen3-235B-A22B · 85.7 · 2025-05-14 Deepseek-R1-0528-Qwen3-8B · 86 · 2025-05-30 Deepseek-R1-0528 · 91.4 · 2025-05-30 Magistral Small · 70.7 · 2025-06-10 Magistral Medium · 73.6 · 2025-06-10 Magistral Medium · 50 · 2025-06-12 GLM-4.5 · 91 · 2025-08-06 GLM-4.5-Air · 89.4 · 2025-08-06 Qwen3-1.7B · 62.4 · 2026-07-07 DeepSeek R1 · 79.8 · 2025-01-20 OpenAI o3 · 91.6 · 2025-04-16
o1 OpenAI o1-preview QwQ-32B-Preview o3 DeepSeek-R1-Distill-Qwen-7B DeepSeek-R1-Zero DeepSeek-R1-Distill-Qwen-32B DeepSeek-R1 s1-32B LIMO Grok 3 mini Claude 3.7 Sonnet GPT-4.5 DeepSeek-V3-0324 Gemini 2.5 Pro Seed1.5-Thinking o4-mini Qwen3-235B-A22B Deepseek-R1-0528-Qwen3-8B Deepseek-R1-0528 Magistral Small Magistral Medium GLM-4.5 GLM-4.5-Air Qwen3-1.7B DeepSeek R1 OpenAI o3
タイムライン
日付 モデル スコア ソース
2026-07-07 Qwen3-1.7B 62.4% Direct-OPDは、弱から強へのRLの利点を蒸留し、より強力なモデルを実現する
2026-03-25 o3 96.7% OpenAI、ChatGPTからo3の退役を発表しベンチマークスコアを公開
2025-08-06 GLM-4.5 91.0% 智譜AIがClaudeやDeepSeekに匹敵するGLM-4.5モデルをリリース
2025-08-06 GLM-4.5-Air 89.4% 智譜AIがClaudeやDeepSeekに匹敵するGLM-4.5モデルをリリース
2025-06-12 Magistral Medium 50.0% MistralがスケーラブルなRLパイプラインを用いたMagistral推論モデルを発表
2025-06-10 Magistral Small 70.7% Mistral AIがオープン版とエンタープライズ版を備えたMagistral推論モデルをリリース
2025-06-10 Magistral Medium 73.6% Mistral AIがオープン版とエンタープライズ版を備えたMagistral推論モデルをリリース
2025-05-30 Deepseek-R1-0528-Qwen3-8B 86.0% DeepSeekがR1モデルを更新し、推論能力とベンチマークスコアを向上
2025-05-30 Deepseek-R1-0528 91.4% DeepSeekがR1モデルを更新し、推論能力とベンチマークスコアを向上
2025-05-14 Qwen3-235B-A22B 85.7% Qwen3が統一思考モードと119言語対応を導入
2025-04-17 o4-mini 93.4% OpenAIが高速で低コストなマルチモーダル推論モデルo4-miniをリリース
2025-04-16 OpenAI o3 91.6% OpenAI
2025-04-10 Seed1.5-Thinking 86.7% Seed1.5-Thinking は強化学習を用いて推論能力を向上させる
2025-03-26 Gemini 2.5 Pro 92.0% Googleが100万トークンコンテキストを備えた実験的なGemini 2.5 Pro推論モデルをリリース
2025-03-24 DeepSeek-V3-0324 59.4% DeepSeek-V3-0324は、DeepSeek-V3と比較して推論、コーディング、中国語の文章作成を改善
2025-03-05 GPT-4.5 36.7% OpenAI、ChatGPT Plus向けに最大規模モデルGPT-4.5をリリース
2025-02-24 Claude 3.7 Sonnet 80.0% Anthropicが動的推論制御機能を備えたClaude 3.7 Sonnetをリリース
2025-02-19 Grok 3 mini 95.8% xAIがGrok 3 BetaとDeepSearchエージェントをリリース
2025-02-05 LIMO 57.1% GAIR-NLPがLIMOをリリース、817サンプルで強力な数学的推論を実現
2025-01-31 s1-32B 57.0% Simple Scaling Labが予算強制によるテスト時のスケーリングを用いたs1-32Bをリリース
2025-01-31 s1-32B 57.0% s1-32Bが単純なテスト時のスケーリングによりo1-previewを上回る
2025-01-22 DeepSeek-R1-Distill-Qwen-7B 55.5% DeepSeek、強化学習によるR1推論モデルをリリース
2025-01-22 DeepSeek-R1-Zero 71.0% DeepSeek、強化学習によるR1推論モデルをリリース
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 72.6% DeepSeek、強化学習によるR1推論モデルをリリース
2025-01-22 DeepSeek-R1 79.8% DeepSeek、強化学習によるR1推論モデルをリリース
2025-01-20 DeepSeek R1 79.8% DeepSeek
2024-12-20 o3 96.7% OpenAI、推論とコーディングで高性能なモデルo3をリリース
2024-11-28 QwQ-32B-Preview 50.0% Qwenが実験的推論モデル「QwQ-32B-Preview」をリリース
2024-10-01 OpenAI o1-preview 83.0% OpenAI o1と他の主要モデルの比較
2024-09-12 o1 13.9% OpenAIが数学・科学ベンチマークで人間の専門家を上回る推論モデルo1-previewをリリース