Benchmark · math

GSM8K

saturated 11 hasil 10 model

GSM8K (Grade School Math 8K) adalah benchmark soal cerita matematika tingkat sekolah dasar yang masing-masing butuh beberapa langkah penalaran aritmetika untuk diselesaikan; model dinilai dari persentase soal yang jawaban angka akhirnya benar.

Selengkapnya
Contoh
Soal cerita singkat seperti «Natalia menjual jepit ke 48 teman pada April dan setengahnya pada Mei; berapa total jepit yang ia jual?» — model harus menelusuri langkah-langkahnya dan memberikan angka akhir.
Penilaian
Skornya adalah accuracy (akurasi): proporsi soal yang jawaban angka akhirnya persis sama dengan jawaban acuan; penalaran di tengah tidak dinilai, hanya angka akhir.
Verifikasi
Verifikasinya otomatis dan berbasis kecocokan persis: angka akhir model diambil (biasanya setelah pemisah seperti «####») lalu dibandingkan dengan jawaban benar, sehingga tidak perlu penilaian manusia.
Mengapa penting
Ia menjadi tes standar yang mudah diperiksa untuk penalaran banyak langkah, dan teknik prompting chain-of-thought yang terkenal terbukti sangat meningkatkan hasilnya, menjadikannya tolok ukur umum kemampuan menalar.
Contoh penyelesaian
Tugas
Maria memiliki 3 kotak krayon dengan 24 krayon di setiap kotak. Ia memberi 15 krayon kepada adiknya, lalu membeli 2 kotak penuh lagi. Berapa banyak krayon yang ia miliki sekarang?
Solusi
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
Penjelasan
Kalikan untuk mendapatkan jumlah awal, kurangi yang diberikan, lalu tambahkan kotak yang baru dibeli: 72 − 15 + 48 = 105. GSM8K hanya menilai angka akhir yang diekstrak setelah pembatas '####' dengan pencocokan persis, jadi langkah-langkah penalarannya tidak dinilai — hanya 105 yang dihitung.
0 25 50 75 100 2023-03-14 2024-11-18 2026-07-26 Grok-1.5 · 90 · 2024-03-28 DUP method · 97.1 · 2024-04-23 Claude 3.5 Sonnet · 91.6 · 2024-06-20 Qwen2-72B · 89.5 · 2024-07-15 Qwen2-72B · 89.5 · 2024-07-15 Falcon3-10B-Base · 83 · 2024-12-17 Falcon3-7B-Base · 79.1 · 2024-12-17 Falcon3-10B-Instruct · 83.1 · 2024-12-17 Gemma-4-12B · 86 · 2026-07-13 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 · 74.2 · 2026-07-26 GPT-4 · 92 · 2023-03-14
Grok-1.5 DUP method Claude 3.5 Sonnet Qwen2-72B Falcon3-10B-Base Falcon3-7B-Base Falcon3-10B-Instruct Gemma-4-12B Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 GPT-4
Linimasa
Tanggal Model Skor Sumber
2026-07-26 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 74.219% CrowdTensor meluncurkan Beta pelatihan sukarelawan dan Kampanye RFC Draft Qwen2.5-7B GSM8K
2026-07-13 Gemma-4-12B 86.0% Flint memampatkan jejak penalaran untuk mengurangi penggunaan token sambil mempertahankan akurasi
2024-12-17 Falcon3-10B-Base 83.0% Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik
2024-12-17 Falcon3-7B-Base 79.1% Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik
2024-12-17 Falcon3-10B-Instruct 83.1% Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik
2024-07-15 Qwen2-72B 89.5% Tim Qwen merilis seri Qwen2 dengan model padat dan MoE 72B
2024-07-15 Qwen2-72B 89.5% Laporan Teknis Qwen2 memperkenalkan model padat dan MoE hingga 72B
2024-06-20 Claude 3.5 Sonnet 91.6% Anthropic merilis tambahan untuk Claude 3.5 Sonnet dengan peningkatan benchmark pemrograman dan visi
2024-04-23 DUP method 97.1% Memahami Masalah Secara Mendalam: Metode Mencapai 97,1% pada GSM8K
2024-03-28 Grok-1.5 90.0% xAI merilis Grok-1.5 dengan penalaran yang ditingkatkan dan konteks 128K
2023-03-14 GPT-4 92.0% OpenAI