Benchmark · math

FrontierMath

20 hasil 15 model

FrontierMath adalah benchmark dari Epoch AI yang mengukur seberapa baik model AI menyelesaikan soal-soal matematika yang sangat sulit, orisinal, dan setingkat penelitian. Skornya adalah persentase soal yang dijawab benar oleh model, dan model masa kini hanya mampu menyelesaikan sebagian kecil — masih jauh dari titik jenuh.

Selengkapnya
Contoh
Satu soal yang belum pernah dipublikasikan sebelumnya dari bidang lanjutan seperti teori bilangan, geometri aljabar, atau kombinatorika, yang penyelesaiannya menuntut keahlian mendalam dan bermuara pada satu jawaban akhir yang pasti (misalnya bilangan bulat tertentu atau objek matematika yang eksak).
Penilaian
Metriknya adalah akurasi (accuracy): proporsi soal yang jawaban akhirnya sama persis dengan jawaban acuan, dinyatakan dalam persen.
Verifikasi
Setiap soal punya satu jawaban pasti yang bisa diperiksa secara otomatis, sehingga sebuah jawaban hanya diterima bila sama persis dengan acuan; soal-soalnya dirancang oleh matematikawan ahli agar hampir mustahil dijawab benar hanya dengan menebak.
Mengapa penting
Karena soalnya baru, benchmark ini tahan terhadap hafalan, dan sampai kini masih jauh dari terpecahkan, sehingga menjadi salah satu dari sedikit benchmark matematika yang masih dengan jelas memisahkan penalaran matematika tingkat lanjut yang sesungguhnya dari sekadar pencocokan pola.
Contoh penyelesaian
Tugas
Tentukan banyaknya bilangan bulat $n$ dengan $0 \le n < 3^{13}$ yang membuat koefisien binomial pusat $\binom{2n}{n}$ tidak habis dibagi $3$.
Solusi
Menurut teorema Kummer, $3 \nmid \binom{2n}{n}$ tepat ketika penjumlahan $n+n$ dalam basis 3 tidak menghasilkan simpanan (carry), yaitu setiap digit basis-3 dari $n$ bernilai 0 atau 1. Pada $0 \le n < 3^{13}$ ini memberi 2 pilihan untuk masing-masing dari 13 digit, sehingga banyaknya adalah $2^{13} = 8192$.
Penjelasan
Teorema Kummer memberikan $v_3\binom{2n}{n}$ sebagai banyaknya simpanan saat menjumlahkan $n$ dengan dirinya sendiri dalam basis 3; nol simpanan mengharuskan setiap digit basis-3 bernilai 0 atau 1, yakni 2 pilihan per digit untuk 13 digit. Penilaian: pemeriksa otomatis mencocokkan secara persis satu-satunya bilangan bulat akhir (8192).
0 14 28 42 56 2024-11-08 2025-08-01 2026-04-25 Claude 3.5 Sonnet · 2 · 2024-11-08 Gemini 1.5 Pro · 2 · 2024-11-08 GPT-4o · 2 · 2024-11-08 o1-preview · 2 · 2024-11-08 o3 · 25 · 2024-12-20 o3 · 25 · 2024-12-22 o3 · 25.2 · 2025-01-19 o3 · 25 · 2025-01-29 o3 · 10 · 2025-04-20 o3-mini with high reasoning and a Python tool · 32 · 2025-03-17 Gemini 2.5 Deep Think · 29 · 2025-10-09 GPT-5 Pro · 13 · 2025-10-13 Claude 4.5 Opus · 21 · 2025-12-04 Gemini 3 Pro · 38 · 2025-12-04 GPT-5.2 Thinking · 40.3 · 2025-12-11 GPT-5.2 Pro · 31 · 2026-01-23 GPT-5.5 Pro · 39.6 · 2026-04-23 GPT-5.5 · 35.4 · 2026-04-23 GPT-5.5 · 51.7 · 2026-04-25 OpenAI o3 · 25.2 · 2024-12-20
Claude 3.5 Sonnet Gemini 1.5 Pro GPT-4o o1-preview o3 o3-mini with high reasoning and a Python tool Gemini 2.5 Deep Think GPT-5 Pro Claude 4.5 Opus Gemini 3 Pro GPT-5.2 Thinking GPT-5.2 Pro GPT-5.5 Pro GPT-5.5 OpenAI o3
Linimasa
Tanggal Model Skor Sumber
2026-04-25 GPT-5.5 51.7% OpenAI merilis GPT-5.5, model yang dilatih ulang dari awal dengan pemrosesan omnimodal asli
2026-04-23 GPT-5.5 Pro 39.6% OpenAI merilis GPT-5.5 dengan kemampuan agentic dan penggandaan harga API
2026-04-23 GPT-5.5 35.4% OpenAI merilis GPT-5.5 dengan kemampuan agentic dan penggandaan harga API
2026-01-23 GPT-5.2 Pro 31.0% GPT-5.2 Pro meraih skor 31% di FrontierMath Tier 4
2025-12-11 GPT-5.2 Thinking 40.3% OpenAI merilis model GPT-5.2 Pro dan Thinking untuk sains dan matematika
2025-12-04 Claude 4.5 Opus 21.0% Epoch AI meluncurkan Hub Pusat Data Frontier dan menganalisis benchmark OSWorld
2025-12-04 Gemini 3 Pro 38.0% Epoch AI meluncurkan Hub Pusat Data Frontier dan menganalisis benchmark OSWorld
2025-10-13 GPT-5 Pro 13.0% GPT-5 Pro memecahkan masalah Tier 4 FrontierMath baru, mendahului Gemini 2.5 Deep Think
2025-10-09 Gemini 2.5 Deep Think 29.0% Epoch AI mengevaluasi kemampuan matematika Gemini 2.5 Deep Think
2025-04-20 o3 10.0% Skor o3 OpenAI lebih rendah di FrontierMath daripada yang awalnya diklaim
2025-03-17 o3-mini with high reasoning and a Python tool 32.0% Evaluasi Epoch terhadap o3-mini di FrontierMath menghasilkan 11% vs 32% dari OpenAI
2025-01-29 o3 25.0% Model o3 OpenAI meraih skor 25% pada benchmark Frontier Math
2025-01-19 o3 25.2% OpenAI mendanai benchmark FrontierMath sebelum o3 memecahkan rekor
2024-12-22 o3 25.0% o3 dari OpenAI meraih skor 25% pada benchmark matematika FrontierMath yang sulit
2024-12-20 o3 25.0% OpenAI memamerkan model penalaran o3 dengan terobosan ARC AGI dan Frontier Math
2024-12-20 OpenAI o3 25.2% Epoch AI
2024-11-08 Claude 3.5 Sonnet 2.0% Epoch AI merilis benchmark FrontierMath untuk mengevaluasi penalaran matematika tingkat lanjut
2024-11-08 Gemini 1.5 Pro 2.0% Epoch AI merilis benchmark FrontierMath untuk mengevaluasi penalaran matematika tingkat lanjut
2024-11-08 GPT-4o 2.0% Epoch AI merilis benchmark FrontierMath untuk mengevaluasi penalaran matematika tingkat lanjut
2024-11-08 o1-preview 2.0% Epoch AI merilis benchmark FrontierMath untuk mengevaluasi penalaran matematika tingkat lanjut