ARC Prize Foundation telah meluncurkan ARC-AGI-2, sebuah benchmark baru yang dirancang untuk mengukur kecerdasan cair dengan menyajikan tugas-tugas yang mudah bagi manusia tetapi sulit bagi sistem AI saat ini. Bersama dengan benchmark tersebut, organisasi ini mengumumkan kompetisi ARC Prize 2025 untuk mendorong kemajuan open-source pada kecerdasan umum yang efisien.
ARC-AGI-2 meningkatkan tingkat kesulitan secara signifikan dibandingkan pendahulunya, di mana LLM murni mendapat skor 0% dan sistem penalaran publik hanya mencapai persentase satu digit. Benchmark ini terdiri dari 120 tugas per set eval (naik dari 100) yang memerlukan interpretasi simbolik, penalaran komposisional, dan penerapan aturan kontekstual. Peserta manusia menyelesaikan setiap tugas dalam dua kali upaya atau kurang, menyoroti kesenjangan antara kemampuan adaptasi manusia dan kemampuan AI saat ini.
Inisiatif ini bertujuan untuk berfungsi sebagai bintang utara bagi penelitian AGI dengan berfokus pada kesenjangan kapabilitas yang tidak muncul dari penskalaan, menginspirasi peneliti untuk mengembangkan ide-ide baru untuk kecerdasan umum.