Benchmark · math

AIME 2024

30 hasil 27 model

AIME 2024 mengukur penalaran matematis tingkat lanjut sebuah model menggunakan 15 soal dari American Invitational Mathematics Examination 2024 dan melaporkan persentase yang terjawab benar.

Selengkapnya
Contoh
Item yang khas adalah soal olimpiade tingkat sekolah yang sulit — misalnya soal teori bilangan atau kombinatorika — yang jawabannya berupa satu bilangan bulat (jawaban AIME selalu bilangan bulat, biasanya dari 0 hingga 999).
Penilaian
Metriknya adalah akurasi: proporsi dari 15 soal yang dijawab benar, sehingga setiap soal yang terpecahkan bernilai 1/15 dari skor.
Verifikasi
Hasil diterima berdasarkan kecocokan persis: jawaban bilangan bulat akhir model harus sama dengan jawaban resmi, diperiksa secara otomatis, tanpa nilai parsial dan tanpa penilaian manusia.
Mengapa penting
Karena merupakan kumpulan ringkas soal kompetisi yang sulit dan baru serta menuntut penalaran banyak langkah, benchmark ini banyak dipakai untuk membandingkan model-model terdepan, dan kebaruannya mengurangi kontaminasi data pelatihan.
Contoh penyelesaian
Tugas
Berapa banyak bilangan bulat positif n ≤ 600 yang habis dibagi 4 atau 6 tetapi tidak habis dibagi 5? (Jawaban AIME berupa bilangan bulat dari 0 sampai 999.)
Solusi
Multiples of 4 or 6 that are ≤ 600: 150 + 100 − 50 = 200. Of these, the ones also divisible by 5 (multiples of 20 or 30, minus 60): 30 + 20 − 10 = 40. Answer: 200 − 40 = 160.
Penjelasan
Dengan prinsip inklusi-eksklusi, 200 bilangan habis dibagi 4 atau 6, dan 40 di antaranya juga habis dibagi 5, sehingga tersisa 160. AIME hanya menilai otomatis bilangan bulat akhir (0–999), tanpa nilai parsial untuk pengerjaan.
0 25 50 75 100 2024-09-12 2025-08-09 2026-07-07 o1 · 13.9 · 2024-09-12 OpenAI o1-preview · 83 · 2024-10-01 QwQ-32B-Preview · 50 · 2024-11-28 o3 · 96.7 · 2024-12-20 o3 · 96.7 · 2026-03-25 DeepSeek-R1-Distill-Qwen-7B · 55.5 · 2025-01-22 DeepSeek-R1-Zero · 71 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 72.6 · 2025-01-22 DeepSeek-R1 · 79.8 · 2025-01-22 s1-32B · 57 · 2025-01-31 s1-32B · 57 · 2025-01-31 LIMO · 57.1 · 2025-02-05 Grok 3 mini · 95.8 · 2025-02-19 Claude 3.7 Sonnet · 80 · 2025-02-24 GPT-4.5 · 36.7 · 2025-03-05 DeepSeek-V3-0324 · 59.4 · 2025-03-24 Gemini 2.5 Pro · 92 · 2025-03-26 Seed1.5-Thinking · 86.7 · 2025-04-10 o4-mini · 93.4 · 2025-04-17 Qwen3-235B-A22B · 85.7 · 2025-05-14 Deepseek-R1-0528-Qwen3-8B · 86 · 2025-05-30 Deepseek-R1-0528 · 91.4 · 2025-05-30 Magistral Small · 70.7 · 2025-06-10 Magistral Medium · 73.6 · 2025-06-10 Magistral Medium · 50 · 2025-06-12 GLM-4.5 · 91 · 2025-08-06 GLM-4.5-Air · 89.4 · 2025-08-06 Qwen3-1.7B · 62.4 · 2026-07-07 DeepSeek R1 · 79.8 · 2025-01-20 OpenAI o3 · 91.6 · 2025-04-16
o1 OpenAI o1-preview QwQ-32B-Preview o3 DeepSeek-R1-Distill-Qwen-7B DeepSeek-R1-Zero DeepSeek-R1-Distill-Qwen-32B DeepSeek-R1 s1-32B LIMO Grok 3 mini Claude 3.7 Sonnet GPT-4.5 DeepSeek-V3-0324 Gemini 2.5 Pro Seed1.5-Thinking o4-mini Qwen3-235B-A22B Deepseek-R1-0528-Qwen3-8B Deepseek-R1-0528 Magistral Small Magistral Medium GLM-4.5 GLM-4.5-Air Qwen3-1.7B DeepSeek R1 OpenAI o3
Linimasa
Tanggal Model Skor Sumber
2026-07-07 Qwen3-1.7B 62.4% Direct-OPD mendistilasi keuntungan RL dari model lemah ke kuat untuk model yang lebih kuat
2026-03-25 o3 96.7% OpenAI mengumumkan pensiunnya o3 dari ChatGPT dan membagikan skor benchmark
2025-08-06 GLM-4.5 91.0% Zhipu AI merilis model GLM-4.5 yang setara dengan Claude dan DeepSeek
2025-08-06 GLM-4.5-Air 89.4% Zhipu AI merilis model GLM-4.5 yang setara dengan Claude dan DeepSeek
2025-06-12 Magistral Medium 50.0% Mistral memperkenalkan model penalaran Magistral dengan pipa RL yang dapat diskalakan
2025-06-10 Magistral Small 70.7% Mistral AI merilis model penalaran Magistral dengan varian terbuka dan enterprise
2025-06-10 Magistral Medium 73.6% Mistral AI merilis model penalaran Magistral dengan varian terbuka dan enterprise
2025-05-30 Deepseek-R1-0528-Qwen3-8B 86.0% DeepSeek memperbarui model R1 dengan penalaran dan skor benchmark yang lebih baik
2025-05-30 Deepseek-R1-0528 91.4% DeepSeek memperbarui model R1 dengan penalaran dan skor benchmark yang lebih baik
2025-05-14 Qwen3-235B-A22B 85.7% Qwen3 memperkenalkan mode berpikir terpadu dan dukungan 119 bahasa
2025-04-17 o4-mini 93.4% OpenAI merilis o4-mini, model penalaran multimodal yang lebih cepat dan murah
2025-04-16 OpenAI o3 91.6% OpenAI
2025-04-10 Seed1.5-Thinking 86.7% Seed1.5-Thinking menggunakan pembelajaran penguatan untuk meningkatkan penalaran
2025-03-26 Gemini 2.5 Pro 92.0% Google merilis model penalaran Gemini 2.5 Pro eksperimental dengan konteks 1M token
2025-03-24 DeepSeek-V3-0324 59.4% DeepSeek-V3-0324 meningkatkan kemampuan penalaran, pemrograman, dan penulisan bahasa Mandarin dibandingkan DeepSeek-V3
2025-03-05 GPT-4.5 36.7% OpenAI merilis GPT-4.5, model terbesarnya, untuk ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 80.0% Anthropic merilis Claude 3.7 Sonnet dengan kontrol penalaran dinamis
2025-02-19 Grok 3 mini 95.8% xAI merilis Grok 3 Beta dan agen DeepSearch
2025-02-05 LIMO 57.1% GAIR-NLP merilis LIMO, mencapai penalaran matematika kuat dengan 817 sampel
2025-01-31 s1-32B 57.0% Lab Simple Scaling merilis s1-32B dengan penskalaan saat pengujian melalui pemaksaan anggaran
2025-01-31 s1-32B 57.0% s1-32B melampaui o1-preview dalam matematika kompetisi menggunakan penskalaan waktu uji sederhana
2025-01-22 DeepSeek-R1-Distill-Qwen-7B 55.5% DeepSeek merilis model penalaran R1 melalui pembelajaran penguatan
2025-01-22 DeepSeek-R1-Zero 71.0% DeepSeek merilis model penalaran R1 melalui pembelajaran penguatan
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 72.6% DeepSeek merilis model penalaran R1 melalui pembelajaran penguatan
2025-01-22 DeepSeek-R1 79.8% DeepSeek merilis model penalaran R1 melalui pembelajaran penguatan
2025-01-20 DeepSeek R1 79.8% DeepSeek
2024-12-20 o3 96.7% OpenAI merilis model o3 dengan kinerja tinggi dalam penalaran dan pemrograman
2024-11-28 QwQ-32B-Preview 50.0% Qwen merilis QwQ-32B-Preview, model penalaran eksperimental
2024-10-01 OpenAI o1-preview 83.0% Membandingkan OpenAI o1 dengan Model Teratas Lainnya
2024-09-12 o1 13.9% OpenAI merilis o1-preview, model penalaran yang melampaui pakar manusia pada benchmark matematika dan sains