Penulis mencapai akurasi state-of-the-art baru sebesar 50% pada set uji publik untuk benchmark penalaran ARC-AGI dengan memanfaatkan GPT-4o untuk menghasilkan dan mengevaluasi ribuan implementasi Python per masalah.

  • Metode ini menghasilkan sekitar 8.000 program Python per masalah menggunakan prompt few-shot dengan penalaran langkah demi langkah.
  • Program dipilih berdasarkan kebenarannya terhadap contoh yang disediakan, dengan pendekatan ensemble untuk variasi ukuran grid.
  • Fase revisi mencoba memperbaiki 12 implementasi paling menjanjikan dengan menunjukkan output aktual mereka dan meminta koreksi.
  • State-of-the-art sebelumnya adalah akurasi 34%, sementara manusia mencapai 85% pada distribusi pelatihan yang lebih mudah.

Hasil ini menunjukkan bahwa model bahasa besar saat ini dapat perform decently well (cukup baik) pada tugas penalaran kompleks melalui pengambilan sampel ekstensif dan verifikasi, menantang klaim bahwa mereka tidak memiliki kemampuan pembelajaran selama inferensi.