Hasil benchmark independen yang dirilis oleh Epoch AI menunjukkan bahwa model o3 yang diluncurkan secara publik oleh OpenAI mendapat skor sekitar 10% pada dataset FrontierMath, jauh di bawah skor lebih dari 25% yang awalnya disorot perusahaan saat pengungkapannya pada Desember.

  • Epoch AI mengevaluasi model o3 yang dirilis menggunakan versi terbaru dari benchmark FrontierMath dan menemukan skor sekitar 10%.
  • Klaim awal OpenAI tentang skor lebih dari 25% dicapai dengan pengaturan komputasi saat pengujian yang agresif pada kerangka internal yang lebih kuat daripada rilis publik.
  • ARC Prize Foundation mengonfirmasi bahwa o3 publik disesuaikan untuk penggunaan obrolan dan produk, dengan tingkat komputasi yang lebih kecil dibandingkan versi pratinjau yang mereka uji.
  • Staf teknis OpenAI menyatakan bahwa model produksi dioptimalkan untuk efisiensi biaya dan kecepatan, bukan untuk kinerja benchmark maksimum.

Perbedaan ini menyoroti pentingnya memverifikasi benchmark pihak ketiga dan memperjelas bahwa model yang dirilis mengutamakan utilitas dunia nyata daripada skor akademik puncak.