Benchmark · math

AIME 2025

31 hasil 27 model

AIME 2025 menguji penalaran matematis tingkat lanjut sebuah model menggunakan 15 soal dari American Invitational Mathematics Examination 2025, sebuah kompetisi tingkat SMA yang sulit. Setiap jawaban berupa bilangan bulat dari 0 sampai 999, dan skor model adalah persentase soal yang dijawab dengan benar (sering dilaporkan sebagai pass@1 atau avg@k).

Selengkapnya
Contoh
Contoh soal yang khas adalah soal kompetisi yang menantang — misalnya teori bilangan atau kombinatorika — yang jawabannya berupa satu bilangan bulat antara 0 dan 999, seperti menentukan banyaknya pasangan terurut yang memenuhi sekumpulan syarat aljabar tertentu.
Penilaian
Masing-masing dari 15 soal dinilai dengan pencocokan persis pada jawaban bilangan bulatnya, dan skornya adalah fraksi (persentase) yang dijawab benar; karena jawaban bervariasi antar-percobaan, hasilnya biasanya dirata-ratakan atas banyak sampel (avg@k) atau dilaporkan sebagai pass@1.
Verifikasi
Verifikasi bersifat otomatis dan objektif: bilangan bulat akhir dari model dibandingkan dengan kunci jawaban resmi, tanpa nilai parsial dan tanpa penilaian manusia, sehingga sebuah solusi hanya diterima bila cocok persis secara numerik.
Mengapa penting
Soal-soal AIME menuntut penalaran kreatif berlangkah banyak, bukan hafalan, sehingga tolok ukur ini menjadi ukuran kemampuan matematika LLM terdepan yang banyak diperhatikan dan angka utama yang sering muncul saat model penalaran baru dirilis.
Contoh penyelesaian
Tugas
Soal representatif bergaya AIME (jawabannya bilangan bulat dari 0 sampai 999): tentukan jumlah semua bilangan bulat positif n yang membuat √(n² + 85n + 2017) menjadi bilangan bulat.
Solusi
Lengkapkan kuadrat: (2m)² − (2n+85)² = 843 = 3·281. Faktorkan selisih kuadrat: (2m−2n−85)(2m+2n+85) = 843, sehingga n = 168 atau n = 27. Jumlah = 168 + 27 = 195.
Penjelasan
Melengkapkan kuadrat mengubah syarat menjadi selisih kuadrat (2m)² − (2n+85)² = 843 = 3·281, yang faktorisasi positif satu-satunya memberi n = 168 dan n = 27, berjumlah 195. AIME dinilai berdasarkan kecocokan persis dari satu jawaban bilangan bulat (0–999), tanpa nilai parsial.
0 25 50 75 100 2025-01-22 2025-10-17 2026-07-13 Kimi k1.5 (short-CoT) · 60.8 · 2025-01-22 Kimi k1.5 · 77.5 · 2025-01-22 Grok 3 (Think) · 93.3 · 2025-02-19 Grok 3 Beta · 93.3 · 2025-02-26 OpenAI o3-mini · 83.3 · 2025-02-26 DeepSeek R1 · 79.8 · 2025-02-26 Claude 3.7 Sonnet · 61.3 · 2025-02-26 Claude 3.5 Sonnet · 41.3 · 2025-02-26 Grok 3 · 93.3 · 2025-03-11 Gemini 2.5 Pro (experimental) · 86.7 · 2025-03-25 Gemini 2.5 Pro · 86.7 · 2025-03-26 OpenAI o3 · 98.4 · 2025-04-16 OpenAI o4-mini · 99.5 · 2025-04-16 o4-mini · 92.7 · 2025-04-17 Qwen3-235B-A22B · 81.5 · 2025-05-14 DeepSeek-R1-0528 · 87.5 · 2025-05-28 Deepseek-R1-0528 · 87.5 · 2025-05-30 Grok 4 · 88 · 2025-07-25 Kimi K2 · 49.5 · 2025-07-28 Kimi K2 · 49.5 · 2025-07-28 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GLM-4.6 · 93.9 · 2025-09-30 Claude Sonnet 4.5 · 100 · 2025-09-30 Kimi K2.5 · 96.1 · 2026-01-27 o1-pro · 86 · 2026-05-14 DASH · 50.8 · 2026-07-05 Agents-A1 · 79 · 2026-07-06 Mach-Mind-4-Flash · 92.7 · 2026-07-13 Mach-Mind-4-Flash · 92.7 · 2026-07-13
Kimi k1.5 (short-CoT) Kimi k1.5 Grok 3 (Think) Grok 3 Beta OpenAI o3-mini DeepSeek R1 Claude 3.7 Sonnet Claude 3.5 Sonnet Grok 3 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro OpenAI o3 OpenAI o4-mini o4-mini Qwen3-235B-A22B DeepSeek-R1-0528 Deepseek-R1-0528 Grok 4 Kimi K2 GPT-5 GLM-4.6 Claude Sonnet 4.5 Kimi K2.5 o1-pro DASH Agents-A1 Mach-Mind-4-Flash
Linimasa
Tanggal Model Skor Sumber
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: Model agentic MoE 35B menyamai model yang lebih besar melalui optimasi pasca-pelatihan
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: Model agentic MoE 35B menyamai model lebih besar melalui optimisasi pasca-pelatihan
2026-07-06 Agents-A1 79.0pts Memperluas Horizon, Bukan Parameter: Mencapai Kinerja Triliun-Parameter dengan Agen 35B
2026-07-05 DASH 50.8% DASH mengurangi overthinking pada model bahasa penalaran melalui penugasan kredit tingkat segmen
2026-05-14 o1-pro 86.0% OpenAI merilis keluarga o1 yang menetapkan era penalaran dengan komputasi saat inferensi
2026-01-27 Kimi K2.5 96.1% Moonshot merilis Kimi K2.5 dengan teknologi Agent Swarm
2025-09-30 GLM-4.6 93.9% Zhipu AI merilis GLM-4.6 dengan kemampuan agentic dan jendela konteks 128k
2025-09-30 Claude Sonnet 4.5 100.0% Anthropic merilis Claude Sonnet 4.5 dengan kemampuan coding dan agen yang ditingkatkan
2025-08-07 GPT-5 94.6% OpenAI meluncurkan GPT-5 dengan penalaran adaptif dan arsitektur terpadu
2025-08-07 GPT-5 94.6% OpenAI memperkenalkan GPT-5 dengan routing terpadu dan penalaran tingkat ahli
2025-08-07 GPT-5 94.6% OpenAI
2025-07-28 Kimi K2 49.5% Kimi K2: model MoE terbuka dengan 1T parameter dan pengoptimal MuonClip
2025-07-28 Kimi K2 49.5% Moonshot merilis Kimi K2, model MoE agentic terbuka dengan 32B parameter aktif
2025-07-25 Grok 4 88.0% Epoch AI mengevaluasi kemampuan matematika Grok 4
2025-05-30 Deepseek-R1-0528 87.5% DeepSeek memperbarui model R1 dengan penalaran dan skor benchmark yang lebih baik
2025-05-28 DeepSeek-R1-0528 87.5% DeepSeek-R1-0528 meningkatkan penalaran dan akurasi AIME menjadi 87,5%
2025-05-14 Qwen3-235B-A22B 81.5% Qwen3 memperkenalkan mode berpikir terpadu dan dukungan 119 bahasa
2025-04-17 o4-mini 92.7% OpenAI merilis o4-mini, model penalaran multimodal yang lebih cepat dan murah
2025-04-16 OpenAI o3 98.4% OpenAI merilis model penalaran o3 dan o4-mini dengan penggunaan alat agentic
2025-04-16 OpenAI o4-mini 99.5% OpenAI merilis model penalaran o3 dan o4-mini dengan penggunaan alat agentic
2025-03-26 Gemini 2.5 Pro 86.7% Google merilis model penalaran Gemini 2.5 Pro eksperimental dengan konteks 1M token
2025-03-25 Gemini 2.5 Pro (experimental) 86.7% Google DeepMind merilis model eksperimen Gemini 2.5 Pro
2025-03-11 Grok 3 93.3% xAI merilis Grok 3 dengan penalaran mendalam dan konteks jutaan token
2025-02-26 Grok 3 Beta 93.3% Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
2025-02-26 OpenAI o3-mini 83.3% Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
2025-02-26 DeepSeek R1 79.8% Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
2025-02-26 Claude 3.7 Sonnet 61.3% Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 41.3% Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
2025-02-19 Grok 3 (Think) 93.3% xAI merilis Grok 3 Beta dan agen DeepSearch
2025-01-22 Kimi k1.5 (short-CoT) 60.8% Kimi k1.5 menskalakan pembelajaran penguatan dengan LLM untuk menyamai o1 dan mengalahkan model short-CoT
2025-01-22 Kimi k1.5 77.5% Kimi k1.5 menskalakan pembelajaran penguatan dengan LLM untuk menyamai o1 dan mengalahkan model short-CoT