Benchmark · math

MATH-500

saturated 18 hasil 17 model

MATH-500 adalah subset berisi 500 soal dari kumpulan data matematika kompetisi MATH, yang menguji kemampuan model menyelesaikan soal matematika yang sulit. Skornya adalah persentase soal yang jawaban akhirnya dijawab benar oleh model.

Selengkapnya
Contoh
Item yang khas adalah soal matematika bergaya kompetisi — misalnya soal aljabar, geometri, atau teori bilangan yang meminta satu jawaban akhir (sebuah angka atau ekspresi bentuk tertutup) setelah beberapa langkah penalaran.
Penilaian
Skornya adalah proporsi dari 500 soal yang dijawab benar oleh model, yaitu accuracy = jawaban akhir yang benar / 500, dinyatakan dalam persen.
Verifikasi
Sebuah soal dianggap terpecahkan ketika jawaban akhir model sama persis dengan jawaban rujukan (pemeriksaan kesetaraan otomatis atas jawaban akhir, bukan langkah-langkah perantaranya).
Mengapa penting
Ini adalah ukuran penalaran matematis yang ringkas dan banyak dipakai serta berjalan lebih cepat daripada set MATH lengkap, sehingga menjadi pemeriksaan cepat yang umum saat membandingkan model penalaran.
Contoh penyelesaian
Tugas
Untuk nilai $k$ tertentu, persamaan kuadrat $x^2 - kx + 16 = 0$ hanya memiliki akar bilangan bulat positif. Tentukan jumlah semua nilai $k$ berbeda yang mungkin.
Solusi
Roots $r,s$: $rs=16$, $k=r+s$. Pairs $(1,16),(2,8),(4,4)\Rightarrow k\in\{17,10,8\}$. Distinct sum $=17+10+8=\boxed{35}$.
Penjelasan
Akar $r,s$ adalah bilangan bulat positif dengan $rs=16$ dan $k=r+s$; pasangan faktor $(1,16),(2,8),(4,4)$ menghasilkan $k=17,10,8$, sehingga jumlah nilai yang berbeda adalah $35$. MATH-500 menilai dengan pencocokan persis jawaban akhir \boxed{} yang dinormalisasi, jadi hanya $35$ yang dihitung.
0 25 50 75 100 2024-02-05 2025-04-21 2026-07-07 DeepSeekMath 7B · 51.7 · 2024-02-05 Grok-1.5 · 50.6 · 2024-03-28 Claude 3.5 Sonnet · 71.1 · 2024-06-20 Claude 3.5 Sonnet · 82.2 · 2025-02-26 QwQ-32B-Preview · 90.6 · 2024-11-28 Kimi k1.5 · 96.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 94.6 · 2025-01-22 DeepSeek-R1 · 97.3 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 94.3 · 2025-01-22 LIMO · 94.8 · 2025-02-05 Claude 3.7 Sonnet · 96.2 · 2025-02-26 Gemini 2.0 Flash · 90.9 · 2025-04-15 Phi-4-Mini-Reasoning · 3.2 · 2025-04-30 Llama-8B · 89.1 · 2025-04-30 Qwen-1.5B · 83.9 · 2025-04-30 GLM-4.5 · 98.2 · 2025-08-06 Qwen3.6-27B · 87 · 2026-07-07 Qwen3.6-27B-DFlash · 86 · 2026-07-07
DeepSeekMath 7B Grok-1.5 Claude 3.5 Sonnet QwQ-32B-Preview Kimi k1.5 Kimi k1.5 (short-CoT) DeepSeek-R1 DeepSeek-R1-Distill-Qwen-32B LIMO Claude 3.7 Sonnet Gemini 2.0 Flash Phi-4-Mini-Reasoning Llama-8B Qwen-1.5B GLM-4.5 Qwen3.6-27B Qwen3.6-27B-DFlash
Linimasa
Tanggal Model Skor Sumber
2026-07-07 Qwen3.6-27B 87.0% DFlash yang digabungkan ke llama.cpp menghasilkan percepatan 4,44x pada Qwen3.6-27B
2026-07-07 Qwen3.6-27B-DFlash 86.0% DFlash yang digabungkan ke llama.cpp menghasilkan percepatan 4,44x pada Qwen3.6-27B
2025-08-06 GLM-4.5 98.2% Zhipu AI merilis model GLM-4.5 yang setara dengan Claude dan DeepSeek
2025-04-30 Phi-4-Mini-Reasoning 3.2% Microsoft merilis Phi-4-Mini-Reasoning, model 3.8B yang mengungguli model penalaran yang lebih besar
2025-04-30 Llama-8B 89.1% Microsoft merilis Phi-4-Mini-Reasoning, model 3.8B yang mengungguli model penalaran yang lebih besar
2025-04-30 Qwen-1.5B 83.9% Microsoft merilis Phi-4-Mini-Reasoning, model 3.8B yang mengungguli model penalaran yang lebih besar
2025-04-15 Gemini 2.0 Flash 90.9% Google merilis Gemini 2.0 Flash dengan kualitas yang ditingkatkan dan kecepatan dua kali lipat dari Gemini 1.5 Pro
2025-02-26 Claude 3.7 Sonnet 96.2% Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 82.2% Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
2025-02-05 LIMO 94.8% GAIR-NLP merilis LIMO, mencapai penalaran matematika kuat dengan 817 sampel
2025-01-22 Kimi k1.5 96.2% Kimi k1.5 menskalakan pembelajaran penguatan dengan LLM untuk menyamai o1 dan mengalahkan model short-CoT
2025-01-22 Kimi k1.5 (short-CoT) 94.6% Kimi k1.5 menskalakan pembelajaran penguatan dengan LLM untuk menyamai o1 dan mengalahkan model short-CoT
2025-01-22 DeepSeek-R1 97.3% DeepSeek merilis model penalaran R1 melalui pembelajaran penguatan
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 94.3% DeepSeek merilis model penalaran R1 melalui pembelajaran penguatan
2024-11-28 QwQ-32B-Preview 90.6% Qwen merilis QwQ-32B-Preview, model penalaran eksperimental
2024-06-20 Claude 3.5 Sonnet 71.1% Anthropic merilis tambahan untuk Claude 3.5 Sonnet dengan peningkatan benchmark pemrograman dan visi
2024-03-28 Grok-1.5 50.6% xAI merilis Grok-1.5 dengan penalaran yang ditingkatkan dan konteks 128K
2024-02-05 DeepSeekMath 7B 51.7% DeepSeekMath 7B mencapai 51,7% pada benchmark MATH menggunakan GRPO dan data kurasi