Benchmark · reasoning

ARC-AGI 1

27 hasil 25 model

ARC-AGI 1 mengukur penalaran abstrak dan generalisasi: setiap tugas menampilkan beberapa contoh grid input→output, dan penyelesai harus menyimpulkan aturan transformasi tersembunyi lalu menghasilkan grid keluaran yang benar untuk input baru. Metriknya adalah persentase tugas yang diselesaikan dengan grid keluaran yang cocok persis.

Selengkapnya
Contoh
Sebuah tugas bisa menampilkan dua atau tiga grid berwarna kecil di mana setiap input berubah menjadi outputnya lewat satu aturan yang sama — misalnya mengisi setiap wilayah tertutup atau mencerminkan sebuah bentuk — dan kamu harus menerapkan aturan simpulan itu pada grid baru yang belum pernah dilihat.
Penilaian
Sebuah tugas dihitung selesai hanya jika grid yang dihasilkan cocok sel demi sel dengan jawaban acuan; skor akhirnya adalah fraksi (persentase) tugas yang terselesaikan di seluruh set evaluasi.
Verifikasi
Pemeriksaan berlangsung otomatis dan persis: grid keluaran yang dikirim dibandingkan sel demi sel dengan grid yang benar, tanpa nilai sebagian dan tanpa pemungutan suara manusia.
Mengapa penting
Teka-tekinya dirancang agar mudah bagi manusia tetapi sulit bagi model yang mengandalkan pola hafalan, sehingga benchmark ini menguji abstraksi sejati dan generalisasi dari sedikit contoh, bukan sekadar pengetahuan yang dihafal — menjadikannya ukuran kemajuan menuju AI yang lebih umum yang banyak diperhatikan.
Contoh penyelesaian
Tugas
ARC-AGI 1 menampilkan beberapa demonstrasi kisi masukan→keluaran, lalu sebuah masukan uji tersembunyi; Anda menyimpulkan transformasinya dan menggambar kisi keluaran yang persis (sel berupa warna 0-9, 0=hitam). Di sini demo mengungkap aturan swa-fraktal: setiap kisi 3×3 mengembang menjadi 9×9, mencap salinan seluruh kisi di tempat sel berwarna dan blok 3×3 kosong di tempat bernilai 0. Masukan uji (3×3): 0 8 0 / 8 8 8 / 0 8 0 (tanda plus berwarna 8).
Solusi
0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0 0 8 0 0 8 0 0 8 0 8 8 8 8 8 8 8 8 8 0 8 0 0 8 0 0 8 0 0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0
Penjelasan
Sel berwarna 8 berada di titik tengah keempat sisi dan di pusat tanda plus; mencap tanda plus tepat pada kelima blok 3×3 itu (dan membiarkan keempat sudut kosong) membangun fraktal 9×9. ARC-AGI hanya memberi nilai untuk kecocokan persis sel-per-sel — satu sel salah saja menggagalkan tugas, dengan maksimal 2 percobaan.
0 24.5 49 73.5 98 2024-06-17 2025-05-17 2026-04-16 GPT-4o · 50 · 2024-06-17 MindsAI · 55.5 · 2024-12-06 Sonnet 3.5.1 · 53.6 · 2024-12-06 MIT & Cornell team · 47.5 · 2024-12-18 Claude Sonnet 3.5 · 53.6 · 2024-12-18 o3 tuned low · 76 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75 · 2026-04-16 o3-preview (low) · 75.7 · 2025-04-20 o3-preview (high) · 87.5 · 2025-04-20 o3-preview-low · 76 · 2025-04-22 o4-mini-medium · 41 · 2025-04-22 o4-mini-low · 21 · 2025-04-22 o3-medium · 53 · 2025-04-22 o3-low · 41 · 2025-04-22 o3-preview-high · 88 · 2025-04-22 HRM · 32 · 2025-08-15 Grok-4 · 79.6 · 2025-09-16 TRM · 45 · 2025-10-06 Tiny Recursive Model (TRM) · 45 · 2025-12-05 CompressARC · 20 · 2025-12-05 GPT-5.2 Pro · 90.5 · 2025-12-11 GPT-5.2 Thinking · 86.2 · 2025-12-11 Opus 4.6 · 93 · 2026-03-09 OpenAI o3 (low compute) · 75.7 · 2024-12-20 OpenAI o3 (high compute) · 87.5 · 2024-12-20
GPT-4o MindsAI Sonnet 3.5.1 MIT & Cornell team Claude Sonnet 3.5 o3 tuned low o3 o3-preview (low) o3-preview (high) o3-preview-low o4-mini-medium o4-mini-low o3-medium o3-low o3-preview-high HRM Grok-4 TRM Tiny Recursive Model (TRM) CompressARC GPT-5.2 Pro GPT-5.2 Thinking Opus 4.6 OpenAI o3 (low compute) OpenAI o3 (high compute)
Linimasa
Tanggal Model Skor Sumber
2026-04-16 o3 75.0% GPT-5.2 mencapai ~53% pada benchmark ARC-AGI-2 pada Desember 2025
2026-03-09 Opus 4.6 93.0% Survei menemukan penurunan kinerja 2-3x pada benchmark ARC-AGI meskipun biaya turun 390x
2025-12-11 GPT-5.2 Pro 90.5% OpenAI merilis GPT-5.2, mengungguli Gemini 3 dalam benchmark pemrograman dan penalaran
2025-12-11 GPT-5.2 Thinking 86.2% OpenAI memperkenalkan GPT-5.2 dengan kemampuan coding, konteks panjang, dan penalaran yang ditingkatkan
2025-12-05 Tiny Recursive Model (TRM) 45.0% Hasil ARC Prize 2025 menyoroti loop penyempurnaan sebagai kunci kemajuan AGI
2025-12-05 CompressARC 20.0% Hasil ARC Prize 2025 menyoroti loop penyempurnaan sebagai kunci kemajuan AGI
2025-10-06 TRM 45.0% Tiny Recursive Model (TRM) mencapai akurasi ARC-AGI lebih tinggi daripada LLM dengan 7 juta parameter
2025-09-16 Grok-4 79.6% ARC-AGI v2 SoTA ditetapkan dengan mengembangkan instruksi bahasa Inggris menggunakan Grok-4
2025-08-15 HRM 32.0% Analisis menemukan bahwa kinerja HRM pada ARC-AGI didorong oleh penyempurnaan loop luar dan hafalan
2025-04-22 o3-preview-low 76.0% ARC Prize Foundation mengevaluasi OpenAI o3 dan o4-mini pada benchmark ARC-AGI
2025-04-22 o4-mini-medium 41.0% ARC Prize Foundation mengevaluasi OpenAI o3 dan o4-mini pada benchmark ARC-AGI
2025-04-22 o4-mini-low 21.0% ARC Prize Foundation mengevaluasi OpenAI o3 dan o4-mini pada benchmark ARC-AGI
2025-04-22 o3-medium 53.0% ARC Prize Foundation mengevaluasi OpenAI o3 dan o4-mini pada benchmark ARC-AGI
2025-04-22 o3-low 41.0% ARC Prize Foundation mengevaluasi OpenAI o3 dan o4-mini pada benchmark ARC-AGI
2025-04-22 o3-preview-high 88.0% ARC Prize Foundation mengevaluasi OpenAI o3 dan o4-mini pada benchmark ARC-AGI
2025-04-20 o3-preview (low) 75.7% Skor o3 OpenAI lebih rendah di FrontierMath daripada yang awalnya diklaim
2025-04-20 o3-preview (high) 87.5% Skor o3 OpenAI lebih rendah di FrontierMath daripada yang awalnya diklaim
2024-12-20 o3 tuned low 76.0% OpenAI memamerkan model penalaran o3 dengan terobosan ARC AGI dan Frontier Math
2024-12-20 o3 75.7% OpenAI o3 mencapai skor terobosan di ARC-AGI-Pub
2024-12-20 o3 75.7% OpenAI merilis model o3 dengan kinerja tinggi dalam penalaran dan pemrograman
2024-12-20 OpenAI o3 (low compute) 75.7% ARC Prize
2024-12-20 OpenAI o3 (high compute) 87.5% ARC Prize
2024-12-18 MIT & Cornell team 47.5% Jeremy Berman dan tim MIT/Cornel mencapai state-of-the-art baru di ARC-AGI-Pub
2024-12-18 Claude Sonnet 3.5 53.6% Jeremy Berman dan tim MIT/Cornel mencapai state-of-the-art baru di ARC-AGI-Pub
2024-12-06 MindsAI 55.5% Pemenang ARC Prize 2024 dipublikasikan; SOTA pada ARC-AGI-1 naik menjadi 55,5%
2024-12-06 Sonnet 3.5.1 53.6% Jeremy Berman mencapai 53,6% pada ARC-AGI-Pub menggunakan Sonnet 3.5 dengan Komputasi Waktu Uji Evolusioner
2024-06-17 GPT-4o 50.0% GPT-4o mencapai SoTA 50% pada ARC-AGI melalui pengambilan sampel masif