Epoch AI telah memperkenalkan FrontierMath, sebuah benchmark yang terdiri dari ratusan soal matematika orisinal yang dirancang oleh para ahli untuk menilai kemampuan penalaran tingkat lanjut pada sistem AI. Dikembangkan bersama lebih dari 60 matematikawan, termasuk penerima Medali Fields, soal-soal tersebut mencakup bidang penelitian modern seperti teori bilangan dan geometri aljabar, yang biasanya membutuhkan waktu berjam-jam atau berhari-hari bagi para ahli untuk diselesaikan.

  • Benchmark ini menampilkan soal-soal yang "tahan tebak" dan dapat diverifikasi secara otomatis melalui komputasi.
  • Evaluasi terhadap enam model terkemuka, termasuk Claude 3.5 Sonnet dan GPT-4o, menunjukkan bahwa tidak ada satu pun yang mampu menyelesaikan lebih dari 2% dari soal-soal tersebut meskipun didukung oleh kerangka kerja ekstensif.
  • Kinerja ini kontras tajam dengan benchmark seperti GSM-8K, di mana model teratas mencapai akurasi lebih dari 90%.
  • Epoch AI berencana melakukan evaluasi secara berkala, memperluas benchmark, dan merilis soal-soal tambahan dalam beberapa bulan mendatang.

FrontierMath bertujuan untuk menyediakan ukuran standar kemajuan dalam penalaran matematika tingkat penelitian seiring dengan kemajuan sistem AI, menyoroti kesenjangan substansial antara kemampuan AI saat ini dan matematikawan ahli.