Pada akhir kompetisi ARC Prize 2024, dua pengiriman baru yang terverifikasi mencapai skor state-of-the-art di Papan Peringkat Publik ARC-AGI (ARC-AGI-Pub). Jeremy Berman mencetak 53,6% menggunakan pendekatan komputasi waktu uji evolusioner dengan Claude Sonnet 3.5, sementara tim gabungan MIT dan Cornell mencapai akurasi 47,5% melalui pelatihan waktu uji.

Metode Jeremy Berman secara iteratif menghasilkan dan menyempurnakan fungsi transformasi Python untuk menghindari maksimum lokal, menghasilkan hingga 500 fungsi per tugas. Kolaborasi MIT/Cornel memanfaatkan teknik induksi dan transduksi yang saling melengkapi, meningkatkan akurasi sebesar 6x dibandingkan model dasar yang di-fine-tune pada model bahasa dengan 8 miliar parameter.

Hasil-hasil ini menunjukkan kemajuan substansial dalam menguji model terdepan terhadap benchmark ARC-AGI menggunakan batasan komputasi yang longgar.