ARC Prize Foundation telah menerbitkan analisis publik pertamanya mengenai model o3 dan o4-mini dari OpenAI pada benchmark penalaran ARC-AGI. Evaluasi ini mengungkapkan bahwa meskipun model-model terdepan ini menunjukkan kemajuan signifikan, mereka belum berhasil menyelesaikan set ARC-AGI-2 yang sulit.

  • o3-medium mencapai 53% pada set ARC-AGI-1 Semi Private Eval, sementara o4-mini-medium mencapai 41% dengan efisiensi tinggi.
  • Baik o3 maupun o4-mini mendapat skor di bawah 3% pada benchmark ARC-AGI-2 yang lebih menantang.
  • Pengaturan penalaran tinggi menyebabkan cakupan tidak lengkap karena timeout atau output yang hilang, sehingga hasil tersebut tidak cocok untuk pelaporan leaderboard.
  • Model o3 produksi berbeda dari o3-preview sebelumnya dengan mengintegrasikan input visual dan menggunakan batasan data pelatihan yang berbeda.

Temuan ini menyoroti bahwa ARC-AGI-1 tetap menjadi alat sensitif untuk mengukur kemampuan model saat ini, sementara ARC-AGI-2 berfungsi sebagai benchmark generasi berikutnya untuk model masa depan yang menutup kesenjangan antara penalaran manusia dan AI.