ベンチマーク · math

AIME 2025

31 結果 27 モデル

AIME 2025 は、難関の高校数学コンテストである 2025 年の American Invitational Mathematics Examination の 15 問を使って、モデルの高度な数学的推論能力を測定します。各問題の答えは 0 から 999 までの整数で、モデルのスコアは正しく解けた問題の割合(多くの場合 pass@1 や avg@k として報告)です。

詳しく見る
典型的な問題は、たとえば整数論や組合せ論といった難度の高いコンテスト問題で、その答えは 0 から 999 までの一つの整数になります。たとえば、与えられた代数的条件を満たす順序対の個数を求める、といった形です。
採点方法
15 問それぞれを整数の答えの完全一致で採点し、スコアは正しく解けた割合(パーセンテージ)です。答えは実行ごとにばらつくため、通常は多数のサンプルで平均を取る(avg@k)か、pass@1 として報告します。
検証方法
検証は自動かつ客観的です。モデルが出した最終的な整数を公式の解答と照合し、部分点も人による判定もないため、数値が完全に一致した場合のみ正解として認められます。
重要な理由
AIME の問題は暗記ではなく多段階の創造的な推論を要求するため、このベンチマークは最先端 LLM の数学能力を測る広く注目される指標であり、新しい推論モデルの発表時によく引き合いに出される代表的な数字です。
解説付きの例
課題
AIME 形式の代表的な問題(答えは 0 から 999 までの整数):√(n² + 85n + 2017) が整数となるすべての正の整数 n の総和を求めよ。
解答
平方完成する:(2m)² − (2n+85)² = 843 = 3·281。平方の差を因数分解する:(2m−2n−85)(2m+2n+85) = 843 より n = 168 または n = 27。総和 = 168 + 27 = 195。
解説
平方完成により条件は平方の差 (2m)² − (2n+85)² = 843 = 3·281 となり、その正の因数分解は n = 168 と n = 27 のみで、和は 195 となる。AIME は唯一の整数解(0–999)の完全一致で採点され、部分点はない。
0 25 50 75 100 2025-01-22 2025-10-17 2026-07-13 Kimi k1.5 (short-CoT) · 60.8 · 2025-01-22 Kimi k1.5 · 77.5 · 2025-01-22 Grok 3 (Think) · 93.3 · 2025-02-19 Grok 3 Beta · 93.3 · 2025-02-26 OpenAI o3-mini · 83.3 · 2025-02-26 DeepSeek R1 · 79.8 · 2025-02-26 Claude 3.7 Sonnet · 61.3 · 2025-02-26 Claude 3.5 Sonnet · 41.3 · 2025-02-26 Grok 3 · 93.3 · 2025-03-11 Gemini 2.5 Pro (experimental) · 86.7 · 2025-03-25 Gemini 2.5 Pro · 86.7 · 2025-03-26 OpenAI o3 · 98.4 · 2025-04-16 OpenAI o4-mini · 99.5 · 2025-04-16 o4-mini · 92.7 · 2025-04-17 Qwen3-235B-A22B · 81.5 · 2025-05-14 DeepSeek-R1-0528 · 87.5 · 2025-05-28 Deepseek-R1-0528 · 87.5 · 2025-05-30 Grok 4 · 88 · 2025-07-25 Kimi K2 · 49.5 · 2025-07-28 Kimi K2 · 49.5 · 2025-07-28 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GLM-4.6 · 93.9 · 2025-09-30 Claude Sonnet 4.5 · 100 · 2025-09-30 Kimi K2.5 · 96.1 · 2026-01-27 o1-pro · 86 · 2026-05-14 DASH · 50.8 · 2026-07-05 Agents-A1 · 79 · 2026-07-06 Mach-Mind-4-Flash · 92.7 · 2026-07-13 Mach-Mind-4-Flash · 92.7 · 2026-07-13
Kimi k1.5 (short-CoT) Kimi k1.5 Grok 3 (Think) Grok 3 Beta OpenAI o3-mini DeepSeek R1 Claude 3.7 Sonnet Claude 3.5 Sonnet Grok 3 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro OpenAI o3 OpenAI o4-mini o4-mini Qwen3-235B-A22B DeepSeek-R1-0528 Deepseek-R1-0528 Grok 4 Kimi K2 GPT-5 GLM-4.6 Claude Sonnet 4.5 Kimi K2.5 o1-pro DASH Agents-A1 Mach-Mind-4-Flash
タイムライン
日付 モデル スコア ソース
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: 35B MoE エージェントモデルがポストトレーニング最適化により大規模モデルに匹敵
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: 35B MoE エージェントモデルがポストトレーニング最適化により大規模モデルに匹敵
2026-07-06 Agents-A1 79.0pts パラメータのスケールアップではなくホライゾンの拡張:35Bエージェントでトリリオン・パラメータ級のパフォーマンスを実現
2026-07-05 DASH 50.8% DASHはセグメントレベルの信用割り当てにより推論言語モデルの過剰思考を削減する
2026-05-14 o1-pro 86.0% OpenAIがo1シリーズをリリース、推論時の計算量で推論の時代を確立
2026-01-27 Kimi K2.5 96.1% Moonshotがエージェントスワーム技術搭載のKimi K2.5をリリース
2025-09-30 GLM-4.6 93.9% 智譜AI、エージェント機能と128kコンテキストウィンドウを備えたGLM-4.6をリリース
2025-09-30 Claude Sonnet 4.5 100.0% AnthropicがClaude Sonnet 4.5をリリース、コーディングとエージェント機能が強化
2025-08-07 GPT-5 94.6% OpenAIが適応的推論と統一アーキテクチャを搭載したGPT-5をリリース
2025-08-07 GPT-5 94.6% OpenAIが統一ルーティングと専門レベルの推論を備えたGPT-5を発表
2025-08-07 GPT-5 94.6% OpenAI
2025-07-28 Kimi K2 49.5% Kimi K2: 1兆パラメータのオープンなMoEモデルとMuonClipオプティマイザ
2025-07-28 Kimi K2 49.5% Moonshotが32Bの活性化パラメータを持つオープンなエージェント型MoEモデル「Kimi K2」をリリース
2025-07-25 Grok 4 88.0% Epoch AIがGrok 4の数学能力を評価
2025-05-30 Deepseek-R1-0528 87.5% DeepSeekがR1モデルを更新し、推論能力とベンチマークスコアを向上
2025-05-28 DeepSeek-R1-0528 87.5% DeepSeek-R1-0528は推論とAIME精度を87.5%に向上
2025-05-14 Qwen3-235B-A22B 81.5% Qwen3が統一思考モードと119言語対応を導入
2025-04-17 o4-mini 92.7% OpenAIが高速で低コストなマルチモーダル推論モデルo4-miniをリリース
2025-04-16 OpenAI o3 98.4% OpenAIがエージェント型ツール利用機能を備えたo3およびo4-mini推論モデルをリリース
2025-04-16 OpenAI o4-mini 99.5% OpenAIがエージェント型ツール利用機能を備えたo3およびo4-mini推論モデルをリリース
2025-03-26 Gemini 2.5 Pro 86.7% Googleが100万トークンコンテキストを備えた実験的なGemini 2.5 Pro推論モデルをリリース
2025-03-25 Gemini 2.5 Pro (experimental) 86.7% Google DeepMind、Gemini 2.5 Pro 実験モデルをリリース
2025-03-11 Grok 3 93.3% xAIが深層推論と100万トークンのコンテキストを持つGrok 3をリリース
2025-02-26 Grok 3 Beta 93.3% Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
2025-02-26 OpenAI o3-mini 83.3% Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
2025-02-26 DeepSeek R1 79.8% Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
2025-02-26 Claude 3.7 Sonnet 61.3% Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
2025-02-26 Claude 3.5 Sonnet 41.3% Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
2025-02-19 Grok 3 (Think) 93.3% xAIがGrok 3 BetaとDeepSearchエージェントをリリース
2025-01-22 Kimi k1.5 (short-CoT) 60.8% Kimi k1.5はLLMを用いた強化学習のスケーリングでo1に追いつき、短CoTモデルを凌駕する
2025-01-22 Kimi k1.5 77.5% Kimi k1.5はLLMを用いた強化学習のスケーリングでo1に追いつき、短CoTモデルを凌駕する