OpenAI mengumumkan model o3 barunya, yang mencapai skor 25% pada benchmark Frontier Math, sebuah lompatan signifikan dari rata-rata sebelumnya sebesar 2% untuk AI generatif. Hasil ini menyoroti peningkatan cepat dalam kemampuan penalaran matematika AI.
- Frontier Math adalah benchmark privat berisi pertanyaan matematika menantang yang dirancang untuk menguji kemampuan mirip manusia tanpa mengandalkan data yang dihafal.
- Model o3 menggunakan rantai pemikiran iteratif, memungkinkannya mengevaluasi dan memperbaiki langkah-langkah penalarannya sendiri sebelum menjawab.
- Proses ini memerlukan komputasi substansial, dengan beberapa pertanyaan individu costing lebih dari $1000 untuk dijawab.
- Berbeda dengan model khusus seperti AlphaProof dari Google DeepMind, o3 adalah AI umum yang menunjukkan keterampilan matematika tingkat lanjut.
Artikel tersebut menyarankan bahwa jika biaya menurun dan skor meningkat, matematikawan AI dapat mengubah metode formal dengan mengotomatisasi proses verifikasi yang saat ini terbatas oleh kelangkaan pakar manusia.