ベンチマーク · math
GSM8K
GSM8K(Grade School Math 8K)は、解くのにそれぞれ複数ステップの算術的推論を要する小学校レベルの文章題のベンチマークで、モデルは最終的な数値の答えが正しかった問題の割合で採点されます。
詳しく見る
- 例
- 「Natalia は4月に48人の友だちにクリップを売り、5月はその半分を売った。合計で何個売ったか?」のような短い文章題で、モデルは手順を追って最終的な数値を答える必要があります。
- 採点方法
- スコアは accuracy(正解率)で、最終的な数値の答えが参照解答と完全一致した問題の割合です。途中の推論は採点されず、最終的な数値だけが対象です。
- 検証方法
- 検証は自動かつ完全一致方式で、モデルの最終数値を(通常は「####」のような区切り記号の後から)取り出して正解と比較するため、人間の判断は不要です。
- 重要な理由
- 多段階推論を測る標準的で検証しやすいテストとなり、有名な chain-of-thought プロンプト手法がこのスコアを大きく引き上げることが示されたため、推論能力の一般的な物差しになりました。
解説付きの例
課題
マリアはクレヨンの箱を 3 箱持っていて、各箱に 24 本入っています。弟に 15 本あげてから、さらに 2 箱まるごと買います。今、彼女は何本のクレヨンを持っていますか?
解答
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
解説
掛け算で最初の本数を求め、あげた分を引き、新しく買った箱を足します:72 − 15 + 48 = 105。GSM8K は '####' 区切りの後に抽出された最終的な数字だけを完全一致で採点するため、推論の各ステップは採点されず、105 だけが正解として数えられます。
| 日付 | モデル | スコア | ソース |
|---|---|---|---|
| 2026-07-26 | Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 | 74.219% | CrowdTensorがボランティア訓練ベータ版とQwen2.5-7B GSM8Kキャンペーン草案RFCをリリース |
| 2026-07-13 | Gemma-4-12B | 86.0% | Flintは推論トレースを圧縮してトークン使用量を削減しつつ精度を維持 |
| 2024-12-17 | Falcon3-10B-Base | 83.0% | Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース |
| 2024-12-17 | Falcon3-7B-Base | 79.1% | Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース |
| 2024-12-17 | Falcon3-10B-Instruct | 83.1% | Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース |
| 2024-07-15 | Qwen2-72B | 89.5% | Qwenチームが72BのDenseおよびMoEモデルを含むQwen2シリーズをリリース |
| 2024-07-15 | Qwen2-72B | 89.5% | Qwen2技術レポートは72Bまでの密集型およびMoEモデルを紹介 |
| 2024-06-20 | Claude 3.5 Sonnet | 91.6% | AnthropicがClaude 3.5 Sonnetの補遺をリリースし、コーディングとビジョンベンチマークが改善 |
| 2024-04-23 | DUP method | 97.1% | 問題を深く理解する方法がGSM8Kで97.1%を達成 |
| 2024-03-28 | Grok-1.5 | 90.0% | xAIが推論能力を強化し128Kのコンテキストに対応したGrok-1.5をリリース |
| 2023-03-14 | GPT-4 | 92.0% | OpenAI |