ベンチマーク · math

GSM8K

saturated 11 結果 10 モデル

GSM8K(Grade School Math 8K)は、解くのにそれぞれ複数ステップの算術的推論を要する小学校レベルの文章題のベンチマークで、モデルは最終的な数値の答えが正しかった問題の割合で採点されます。

詳しく見る
「Natalia は4月に48人の友だちにクリップを売り、5月はその半分を売った。合計で何個売ったか?」のような短い文章題で、モデルは手順を追って最終的な数値を答える必要があります。
採点方法
スコアは accuracy(正解率)で、最終的な数値の答えが参照解答と完全一致した問題の割合です。途中の推論は採点されず、最終的な数値だけが対象です。
検証方法
検証は自動かつ完全一致方式で、モデルの最終数値を(通常は「####」のような区切り記号の後から)取り出して正解と比較するため、人間の判断は不要です。
重要な理由
多段階推論を測る標準的で検証しやすいテストとなり、有名な chain-of-thought プロンプト手法がこのスコアを大きく引き上げることが示されたため、推論能力の一般的な物差しになりました。
解説付きの例
課題
マリアはクレヨンの箱を 3 箱持っていて、各箱に 24 本入っています。弟に 15 本あげてから、さらに 2 箱まるごと買います。今、彼女は何本のクレヨンを持っていますか?
解答
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
解説
掛け算で最初の本数を求め、あげた分を引き、新しく買った箱を足します:72 − 15 + 48 = 105。GSM8K は '####' 区切りの後に抽出された最終的な数字だけを完全一致で採点するため、推論の各ステップは採点されず、105 だけが正解として数えられます。
0 25 50 75 100 2023-03-14 2024-11-18 2026-07-26 Grok-1.5 · 90 · 2024-03-28 DUP method · 97.1 · 2024-04-23 Claude 3.5 Sonnet · 91.6 · 2024-06-20 Qwen2-72B · 89.5 · 2024-07-15 Qwen2-72B · 89.5 · 2024-07-15 Falcon3-10B-Base · 83 · 2024-12-17 Falcon3-7B-Base · 79.1 · 2024-12-17 Falcon3-10B-Instruct · 83.1 · 2024-12-17 Gemma-4-12B · 86 · 2026-07-13 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 · 74.2 · 2026-07-26 GPT-4 · 92 · 2023-03-14
Grok-1.5 DUP method Claude 3.5 Sonnet Qwen2-72B Falcon3-10B-Base Falcon3-7B-Base Falcon3-10B-Instruct Gemma-4-12B Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 GPT-4
タイムライン
日付 モデル スコア ソース
2026-07-26 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 74.219% CrowdTensorがボランティア訓練ベータ版とQwen2.5-7B GSM8Kキャンペーン草案RFCをリリース
2026-07-13 Gemma-4-12B 86.0% Flintは推論トレースを圧縮してトークン使用量を削減しつつ精度を維持
2024-12-17 Falcon3-10B-Base 83.0% Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース
2024-12-17 Falcon3-7B-Base 79.1% Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース
2024-12-17 Falcon3-10B-Instruct 83.1% Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース
2024-07-15 Qwen2-72B 89.5% Qwenチームが72BのDenseおよびMoEモデルを含むQwen2シリーズをリリース
2024-07-15 Qwen2-72B 89.5% Qwen2技術レポートは72Bまでの密集型およびMoEモデルを紹介
2024-06-20 Claude 3.5 Sonnet 91.6% AnthropicがClaude 3.5 Sonnetの補遺をリリースし、コーディングとビジョンベンチマークが改善
2024-04-23 DUP method 97.1% 問題を深く理解する方法がGSM8Kで97.1%を達成
2024-03-28 Grok-1.5 90.0% xAIが推論能力を強化し128Kのコンテキストに対応したGrok-1.5をリリース
2023-03-14 GPT-4 92.0% OpenAI