OpenAI telah memamerkan model bahasa penalaran o3 barunya, menandakan kemajuan pesat dalam kemampuan AI menjelang rilis publik pada akhir Januari 2025. Pengumuman ini menyoroti lompatan kinerja yang signifikan dibandingkan model state-of-the-art sebelumnya seperti Gemini 1.5 Pro dan Claude 3.5 Sonnet.

  • o3 adalah model pertama yang melampaui ambang batas 85% pada set publik hadiah ARC AGI, sebuah benchmark yang dirancang untuk mengukur kecerdasan cair mirip manusia.
  • Model ini mencapai skor 25% pada benchmark Frontier Math, peningkatan substansial dari state-of-the-art sebelumnya sebesar 2%.
  • Model ini mencapai kinerja tingkat Grandmaster Internasional di Codeforces dan menetapkan state-of-the-art baru di SWE-Bench-Verified dengan skor 71,7%.
  • OpenAI juga merilis penelitian mengenai alignment deliberatif, menunjukkan bagaimana model kelas o1 dapat meningkatkan studi keamanan dan alignment.

Hasil-hasil ini menunjukkan bahwa model penalaran mulai memberikan nilai melampaui domain yang dapat diverifikasi seperti matematika dan pemrograman, berpotensi mempercepat kemajuan di seluruh ekosistem riset AI.