Sistem o3 baru dari OpenAI, yang dilatih pada set pelatihan publik ARC-AGI-1, telah mencetak skor 75,7% pada set evaluasi semi-pribadi dalam batas komputasi $10k dan 87,5% dengan konfigurasi komputasi tinggi.
- Skor efisiensi tinggi memenuhi syarat sebagai tempat ke-1 di papan peringkat publik sesuai aturan ARC-AGI-Pub.
- Pengujian dilakukan pada dua tingkat komputasi: 6 sampel untuk efisiensi tinggi dan 1024 sampel (172x komputasi) untuk efisiensi rendah.
- OpenAI mengonfirmasi bahwa versi yang diuji berbeda dari o3 yang dirilis secara resmi, dengan hasil pembaruan akan menyusul.
ARC Prize melihat ini sebagai peningkatan langkah fungsi yang signifikan dalam kemampuan AI, menunjukkan kemampuan adaptasi tugas baru yang tidak terlihat pada model keluarga GPT sebelumnya.