ベンチマーク · math

FrontierMath

20 結果 15 モデル

FrontierMath は Epoch AI が公開したベンチマークで、AI モデルが極めて難しく独創的な研究レベルの数学問題をどれだけ解けるかを測る。スコアはモデルが正しく解けた問題の割合で、現在のモデルはごく一部しか解けておらず、飽和には程遠い。

詳しく見る
整数論、代数幾何、組合せ論といった高度な分野から選ばれた、これまで未公開の一問。解くには深い専門知識が必要で、最終的に一つの確定した答え(たとえば特定の整数や厳密な数学的対象)に帰着する。
採点方法
指標は正解率(accuracy)で、最終的な答えが参照解と完全に一致した問題の割合をパーセントで表す。
検証方法
各問題には一つの確定した、自動で検証できる答えがあり、参照解と完全に一致したときだけ正解とみなされる。問題は専門の数学者が作成しており、当て推量ではまず正解できないよう設計されている。
重要な理由
問題が新規のため丸暗記が効かず、今なお解ききられていないため、本物の高度な数学的推論とパターン照合とを今でも明確に切り分けられる、数少ない数学ベンチマークの一つだ。
解説付きの例
課題
$0 \le n < 3^{13}$ を満たし、中心二項係数 $\binom{2n}{n}$ が $3$ で割り切れないような整数 $n$ の個数を求めよ。
解答
Kummer の定理により、$3 \nmid \binom{2n}{n}$ となるのは、3 進法で $n+n$ を足したときに繰り上がりが生じない場合、すなわち $n$ の各 3 進桁が 0 または 1 のときに限る。$0 \le n < 3^{13}$ の範囲では、これは 13 桁それぞれに 2 通りの選択を与えるので、個数は $2^{13} = 8192$ となる。
解説
Kummer の定理は $v_3\binom{2n}{n}$ を、3 進法で $n$ を自身に足すときの繰り上がりの回数として与える。繰り上がりがゼロであるには各 3 進桁が 0 か 1 でなければならず、13 桁で 1 桁あたり 2 通りとなる。採点:自動チェッカーが唯一の最終整数(8192)を厳密に照合する。
0 14 28 42 56 2024-11-08 2025-08-01 2026-04-25 Claude 3.5 Sonnet · 2 · 2024-11-08 Gemini 1.5 Pro · 2 · 2024-11-08 GPT-4o · 2 · 2024-11-08 o1-preview · 2 · 2024-11-08 o3 · 25 · 2024-12-20 o3 · 25 · 2024-12-22 o3 · 25.2 · 2025-01-19 o3 · 25 · 2025-01-29 o3 · 10 · 2025-04-20 o3-mini with high reasoning and a Python tool · 32 · 2025-03-17 Gemini 2.5 Deep Think · 29 · 2025-10-09 GPT-5 Pro · 13 · 2025-10-13 Claude 4.5 Opus · 21 · 2025-12-04 Gemini 3 Pro · 38 · 2025-12-04 GPT-5.2 Thinking · 40.3 · 2025-12-11 GPT-5.2 Pro · 31 · 2026-01-23 GPT-5.5 Pro · 39.6 · 2026-04-23 GPT-5.5 · 35.4 · 2026-04-23 GPT-5.5 · 51.7 · 2026-04-25 OpenAI o3 · 25.2 · 2024-12-20
Claude 3.5 Sonnet Gemini 1.5 Pro GPT-4o o1-preview o3 o3-mini with high reasoning and a Python tool Gemini 2.5 Deep Think GPT-5 Pro Claude 4.5 Opus Gemini 3 Pro GPT-5.2 Thinking GPT-5.2 Pro GPT-5.5 Pro GPT-5.5 OpenAI o3
タイムライン
日付 モデル スコア ソース
2026-04-25 GPT-5.5 51.7% OpenAIがGPT-5.5をリリース、ネイティブオムニモーダル処理を搭載したゼロからの再学習モデル
2026-04-23 GPT-5.5 Pro 39.6% OpenAIがGPT-5.5をリリース、エージェント機能搭載とAPI価格の倍増
2026-04-23 GPT-5.5 35.4% OpenAIがGPT-5.5をリリース、エージェント機能搭載とAPI価格の倍増
2026-01-23 GPT-5.2 Pro 31.0% GPT-5.2 ProがFrontierMath Tier 4で31%を達成
2025-12-11 GPT-5.2 Thinking 40.3% OpenAIが科学と数学向けにGPT-5.2 ProおよびThinkingモデルをリリース
2025-12-04 Claude 4.5 Opus 21.0% Epoch AIがフロンティアデータセンターハブを立ち上げ、OSWorldベンチマークを分析
2025-12-04 Gemini 3 Pro 38.0% Epoch AIがフロンティアデータセンターハブを立ち上げ、OSWorldベンチマークを分析
2025-10-13 GPT-5 Pro 13.0% GPT-5 ProがFrontierMath Tier 4の問題を解決し、Gemini 2.5 Deep Thinkに僅差で先行
2025-10-09 Gemini 2.5 Deep Think 29.0% Epoch AIがGemini 2.5 Deep Thinkの数学能力を評価
2025-04-20 o3 10.0% OpenAIのo3はFrontierMathで当初主張されたよりも低いスコア
2025-03-17 o3-mini with high reasoning and a Python tool 32.0% FrontierMathにおけるEpochのo3-mini評価は11%、OpenAIは32%
2025-01-29 o3 25.0% OpenAIのo3モデルがFrontier Mathベンチマークで25%のスコアを達成
2025-01-19 o3 25.2% OpenAIはo3が記録を更新する前にFrontierMathベンチマークに資金を提供
2024-12-22 o3 25.0% OpenAIのo3がFrontierMathの難問ベンチマークで25%のスコアを記録
2024-12-20 o3 25.0% OpenAI、ARC AGIおよびFrontier Mathでの突破を示すo3推論モデルをプレビュー
2024-12-20 OpenAI o3 25.2% Epoch AI
2024-11-08 Claude 3.5 Sonnet 2.0% Epoch AIが高度な数学的推論を評価するためのFrontierMathベンチマークを公開
2024-11-08 Gemini 1.5 Pro 2.0% Epoch AIが高度な数学的推論を評価するためのFrontierMathベンチマークを公開
2024-11-08 GPT-4o 2.0% Epoch AIが高度な数学的推論を評価するためのFrontierMathベンチマークを公開
2024-11-08 o1-preview 2.0% Epoch AIが高度な数学的推論を評価するためのFrontierMathベンチマークを公開