ベンチマーク · math

MATH-500

saturated 18 結果 17 モデル

MATH-500 は、競技数学のデータセット MATH から 500 問を抜き出したサブセットで、難しい数学問題を解くモデルの能力を測ります。スコアは、モデルが最終的な答えを正解した問題の割合(パーセント)です。

詳しく見る
典型的な問題は競技レベルの数学問題で、たとえば代数・幾何・数論の問題を数ステップ推論した末に、単一の最終的な答え(数値や閉じた形の式)を求めるものです。
採点方法
スコアは 500 問のうちモデルが正解した割合、すなわち accuracy = 正しい最終回答数 / 500 で、パーセントで表します。
検証方法
モデルの最終的な答えが参照解答と完全に一致したときにその問題は正解とみなされます(途中の手順ではなく、最終的な答えの自動的な等価性チェック)。
重要な理由
これは数学的推論を測る、コンパクトで広く使われる指標であり、完全な MATH セットより速く実行できるため、推論モデルを比較する際の手軽なチェックとしてよく使われます。
解説付きの例
課題
ある $k$ の値に対して、二次方程式 $x^2 - kx + 16 = 0$ は正の整数解のみを持つ。$k$ の相異なるすべての可能な値の総和を求めよ。
解答
Roots $r,s$: $rs=16$, $k=r+s$. Pairs $(1,16),(2,8),(4,4)\Rightarrow k\in\{17,10,8\}$. Distinct sum $=17+10+8=\boxed{35}$.
解説
解 $r,s$ は $rs=16$ かつ $k=r+s$ を満たす正の整数であり、因数の組 $(1,16),(2,8),(4,4)$ から $k=17,10,8$ が得られるので、相異なる値の和は $35$ である。MATH-500 は正規化した最終的な \boxed{} の答えの完全一致で採点するため、$35$ のみが正解となる。
0 25 50 75 100 2024-02-05 2025-04-21 2026-07-07 DeepSeekMath 7B · 51.7 · 2024-02-05 Grok-1.5 · 50.6 · 2024-03-28 Claude 3.5 Sonnet · 71.1 · 2024-06-20 Claude 3.5 Sonnet · 82.2 · 2025-02-26 QwQ-32B-Preview · 90.6 · 2024-11-28 Kimi k1.5 · 96.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 94.6 · 2025-01-22 DeepSeek-R1 · 97.3 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 94.3 · 2025-01-22 LIMO · 94.8 · 2025-02-05 Claude 3.7 Sonnet · 96.2 · 2025-02-26 Gemini 2.0 Flash · 90.9 · 2025-04-15 Phi-4-Mini-Reasoning · 3.2 · 2025-04-30 Llama-8B · 89.1 · 2025-04-30 Qwen-1.5B · 83.9 · 2025-04-30 GLM-4.5 · 98.2 · 2025-08-06 Qwen3.6-27B · 87 · 2026-07-07 Qwen3.6-27B-DFlash · 86 · 2026-07-07
DeepSeekMath 7B Grok-1.5 Claude 3.5 Sonnet QwQ-32B-Preview Kimi k1.5 Kimi k1.5 (short-CoT) DeepSeek-R1 DeepSeek-R1-Distill-Qwen-32B LIMO Claude 3.7 Sonnet Gemini 2.0 Flash Phi-4-Mini-Reasoning Llama-8B Qwen-1.5B GLM-4.5 Qwen3.6-27B Qwen3.6-27B-DFlash
タイムライン
日付 モデル スコア ソース
2026-07-07 Qwen3.6-27B 87.0% llama.cppにDFlashがマージされ、Qwen3.6-27Bで4.44倍の高速化を実現
2026-07-07 Qwen3.6-27B-DFlash 86.0% llama.cppにDFlashがマージされ、Qwen3.6-27Bで4.44倍の高速化を実現
2025-08-06 GLM-4.5 98.2% 智譜AIがClaudeやDeepSeekに匹敵するGLM-4.5モデルをリリース
2025-04-30 Phi-4-Mini-Reasoning 3.2% Microsoft、3.8BモデルPhi-4-Mini-Reasoningをリリースし、より大きな推論モデルを上回る性能を実現
2025-04-30 Llama-8B 89.1% Microsoft、3.8BモデルPhi-4-Mini-Reasoningをリリースし、より大きな推論モデルを上回る性能を実現
2025-04-30 Qwen-1.5B 83.9% Microsoft、3.8BモデルPhi-4-Mini-Reasoningをリリースし、より大きな推論モデルを上回る性能を実現
2025-04-15 Gemini 2.0 Flash 90.9% Google、Gemini 1.5 Proの2倍の速度と向上した品質を持つGemini 2.0 Flashをリリース
2025-02-26 Claude 3.7 Sonnet 96.2% Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
2025-02-26 Claude 3.5 Sonnet 82.2% Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
2025-02-05 LIMO 94.8% GAIR-NLPがLIMOをリリース、817サンプルで強力な数学的推論を実現
2025-01-22 Kimi k1.5 96.2% Kimi k1.5はLLMを用いた強化学習のスケーリングでo1に追いつき、短CoTモデルを凌駕する
2025-01-22 Kimi k1.5 (short-CoT) 94.6% Kimi k1.5はLLMを用いた強化学習のスケーリングでo1に追いつき、短CoTモデルを凌駕する
2025-01-22 DeepSeek-R1 97.3% DeepSeek、強化学習によるR1推論モデルをリリース
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 94.3% DeepSeek、強化学習によるR1推論モデルをリリース
2024-11-28 QwQ-32B-Preview 90.6% Qwenが実験的推論モデル「QwQ-32B-Preview」をリリース
2024-06-20 Claude 3.5 Sonnet 71.1% AnthropicがClaude 3.5 Sonnetの補遺をリリースし、コーディングとビジョンベンチマークが改善
2024-03-28 Grok-1.5 50.6% xAIが推論能力を強化し128Kのコンテキストに対応したGrok-1.5をリリース
2024-02-05 DeepSeekMath 7B 51.7% DeepSeekMath 7BがGRPOとキュレーションされたデータを使用してMATHベンチマークで51.7%を達成