Model bahasa terbaru dari OpenAI, o3, mencapai skor 25% pada FrontierMath, sebuah dataset rahasia berisi ratusan pertanyaan matematika sulit yang dikurasi oleh Epoch AI. Dataset ini terdiri dari masalah dengan jawaban definitif dan terkomputasi yang dapat diverifikasi secara otomatis, dirancang untuk mencegah model sekadar menghafal solusi publik.
- FrontierMath berisi "ratusan" pertanyaan matematika sulit, dengan kurang dari 200 soal yang dirilis awalnya dan lebih banyak ditambahkan kemudian.
- Lima contoh masalah yang tersedia secara publik memerlukan jawaban bilangan bulat positif, seperti 9811 dan 367707, serta melibatkan konsep kompleks seperti kontinuitas p-adic dan konjektur Weil.
- Meskipun penulis dapat menyelesaikan dua dari lima soal publik tersebut menggunakan keahliannya dalam aritmetika, ia mencatat bahwa mahasiswa matematika tingkat sarjana yang cerdas secara umum kemungkinan besar akan kesulitan bahkan dengan satu soal.
- Elliot Glazer dari Epoch AI menyarankan bahwa 25% dari dataset terdiri dari "masalah bergaya IMO/sarjana", menimbulkan pertanyaan tentang tingkat kesulitan keseluruhan dan representativitas sampel publik.
Pencapaian ini signifikan karena bidang AI untuk matematika kekurangan dataset sulit, dan pembuatan benchmark semacam itu sulit serta mahal. Penulis menyatakan terkejut dengan skor tersebut, mencatat bahwa meskipun AI berkembang pesat pada masalah bergaya Olimpiade, mencapai inovasi tingkat sarjana lanjutan atau PhD sebelumnya dianggap sebagai tujuan yang jauh.