Benchmark · reasoning

ARC-AGI 2

33 hasil 28 model

ARC-AGI 2 (Abstraction & Reasoning Corpus, versi 2, diselenggarakan sebagai ARC Prize 2025) mengukur penalaran cair (fluid reasoning): menyimpulkan aturan abstrak dari beberapa contoh dan menerapkannya pada kasus baru. Skornya adalah persentase teka-teki yang terpecahkan dengan benar pada set evaluasi tersembunyi yang semi-privat.

Selengkapnya
Contoh
Sebuah tugas memberikan beberapa pasangan input→output berupa grid berwarna (grid kecil berisi sel-sel berwarna yang diubah dengan satu cara yang konsisten), dan penyelesai harus menemukan transformasi tersembunyi itu dan menghasilkan grid output yang benar untuk input baru.
Penilaian
Setiap teka-teki dinilai lulus/gagal: grid output yang dihasilkan dibandingkan dengan grid yang benar secara persis, dan skor yang dilaporkan adalah persentase teka-teki yang terpecahkan pada set evaluasi semi-privat.
Verifikasi
Hasil diverifikasi secara otomatis melalui kecocokan persis pada grid output — grid yang diprediksi harus cocok dengan jawaban sel demi sel — pada set uji semi-privat yang tidak dirilis ke publik untuk mencegah hafalan.
Mengapa penting
Ia berfokus pada teka-teki yang mudah bagi manusia tetapi sulit bagi AI, sehingga menjadi tolok ukur yang banyak diperhatikan untuk abstraksi sejati dan penalaran umum, bukan pengetahuan hafalan.
Contoh penyelesaian
Tugas
Teka-teki grid ARC-AGI-2: simpulkan transformasinya dari pasangan latihan, lalu berikan grid keluaran untuk masukan uji (angka 0–9 adalah warna; 0 = latar hitam). Latihan 1: [[4,0,0,0],[0,0,6,0],[4,0,0,0],[0,0,6,0]] → [[0,0,0,0],[0,0,0,0],[4,0,6,0],[4,0,6,0]]. Latihan 2: [[0,3,0,0],[0,0,0,8],[0,3,0,0],[0,0,0,0]] → [[0,0,0,0],[0,0,0,0],[0,3,0,0],[0,3,0,8]]. Uji: [[0,0,2,0],[5,0,0,0],[0,0,2,0],[5,0,0,0]] → ?
Solusi
[[0, 0, 0, 0], [0, 0, 0, 0], [5, 0, 2, 0], [5, 0, 2, 0]]
Penjelasan
Setiap pasangan latihan menunjukkan satu aturan — 'gravitasi': tiap sel berwarna jatuh lurus ke bawah menuju sel kosong terbawah pada kolomnya, mempertahankan warna dan jumlahnya, sementara latar (0) naik ke atas. Pada uji, dua angka 5 di kolom 0 dan dua angka 2 di kolom 2 mengendap di dua baris terbawah. ARC-AGI-2 menilai dengan pencocokan grid yang persis — dimensi benar dan nilai tiap sel — dengan skor pass@2 atas dua percobaan yang diizinkan.
0 25 50 75 100 2024-12-20 2025-10-11 2026-08-03 o3 tuned high · 87 · 2024-12-20 public AI reasoning systems · 9 · 2025-03-24 o4-mini-medium · 3 · 2025-04-22 o4-mini-low · 3 · 2025-04-22 o3-medium · 3 · 2025-04-22 o3-low · 3 · 2025-04-22 Grok 4 · 15.9 · 2025-07-09 Grok 4 · 15.9 · 2025-08-08 HRM · 2 · 2025-08-15 Grok-4 · 29.4 · 2025-09-16 TRM · 8 · 2025-10-06 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 84.6 · 2026-02-12 Gemini 3 Pro (Poetiq refinement) · 54 · 2025-12-05 NVARC (fine-tuned 4B model variant) · 27.6 · 2025-12-05 Poetiq's system (Gemini-based configuration) · 54 · 2025-12-05 Opus 4.5 (Thinking, 64k) · 37.6 · 2025-12-05 Tiny Recursive Model (TRM) · 8 · 2025-12-05 GPT-5.2 Thinking · 52.9 · 2025-12-11 GPT-5.2 Thinking · 52.9 · 2025-12-11 Claude Opus 4.6 · 68.8 · 2026-02-05 Claude Opus 4.6 · 69 · 2026-04-16 Gemini 3.1 Pro · 77.1 · 2026-02-19 Imbue’s Darwinian Evolver · 95.1 · 2026-04-16 Confluence Lab · 97.9 · 2026-04-16 Gemini 3 “Deep Think” · 84.6 · 2026-04-16 GPT-5.4 Pro · 83.3 · 2026-04-16 GPT-5.2 · 53 · 2026-04-16 GPT-5.5 · 85 · 2026-04-25 Gemini 3 Pro · 54 · 2026-07-06 GPT-5.2 Pro · 54.2 · 2026-07-06 Inkling-Small · 40.1 · 2026-08-03
o3 tuned high public AI reasoning systems o4-mini-medium o4-mini-low o3-medium o3-low Grok 4 HRM Grok-4 TRM Gemini 3 Deep Think Gemini 3 Pro (Poetiq refinement) NVARC (fine-tuned 4B model variant) Poetiq's system (Gemini-based configuration) Opus 4.5 (Thinking, 64k) Tiny Recursive Model (TRM) GPT-5.2 Thinking Claude Opus 4.6 Gemini 3.1 Pro Imbue’s Darwinian Evolver Confluence Lab Gemini 3 “Deep Think” GPT-5.4 Pro GPT-5.2 GPT-5.5 Gemini 3 Pro GPT-5.2 Pro Inkling-Small
Linimasa
Tanggal Model Skor Sumber
2026-08-03 Inkling-Small 40.1% Thinking Machines Lab merilis Inkling-Small, model MoE multimodal dengan bobot terbuka 276B
2026-07-06 Gemini 3 Pro 54.0% Pencarian Berbasis Modalitas dengan Penilaian Jejak Holistik untuk ARC-AGI-2
2026-07-06 GPT-5.2 Pro 54.2% Pencarian Berbasis Modalitas dengan Penilaian Jejak Holistik untuk ARC-AGI-2
2026-04-25 GPT-5.5 85.0% OpenAI merilis GPT-5.5, model yang dilatih ulang dari awal dengan pemrosesan omnimodal asli
2026-04-16 Imbue’s Darwinian Evolver 95.1% GPT-5.2 mencapai ~53% pada benchmark ARC-AGI-2 pada Desember 2025
2026-04-16 Confluence Lab 97.9% GPT-5.2 mencapai ~53% pada benchmark ARC-AGI-2 pada Desember 2025
2026-04-16 Gemini 3 “Deep Think” 84.6% GPT-5.2 mencapai ~53% pada benchmark ARC-AGI-2 pada Desember 2025
2026-04-16 GPT-5.4 Pro 83.3% GPT-5.2 mencapai ~53% pada benchmark ARC-AGI-2 pada Desember 2025
2026-04-16 GPT-5.2 53.0% GPT-5.2 mencapai ~53% pada benchmark ARC-AGI-2 pada Desember 2025
2026-04-16 Claude Opus 4.6 69.0% GPT-5.2 mencapai ~53% pada benchmark ARC-AGI-2 pada Desember 2025
2026-02-19 Gemini 3.1 Pro 77.1% Google merilis Gemini 3.1 Pro dengan penalaran yang ditingkatkan
2026-02-12 Gemini 3 Deep Think 84.6% Google merilis Gemini 3 Deep Think yang ditingkatkan dengan skor benchmark baru
2026-02-05 Claude Opus 4.6 68.8% Anthropic merilis Claude Opus 4.6 dengan jendela konteks 1M dan peningkatan agentic
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI memperkenalkan GPT-5.2 dengan kemampuan coding, konteks panjang, dan penalaran yang ditingkatkan
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI merilis GPT-5.2, mengungguli Gemini 3 dalam benchmark pemrograman dan penalaran
2025-12-05 Gemini 3 Pro (Poetiq refinement) 54.0% Hasil ARC Prize 2025 menyoroti loop penyempurnaan sebagai kunci kemajuan AGI
2025-12-05 NVARC (fine-tuned 4B model variant) 27.64% Peneliti NVIDIA memenangkan Kaggle ARC Prize 2025 dengan penalaran AGI yang hemat biaya
2025-12-05 Poetiq's system (Gemini-based configuration) 54.0% Poetiq mencapai 54% pada ARC-AGI-2 dengan separuh biaya menggunakan meta-system
2025-12-05 Opus 4.5 (Thinking, 64k) 37.6% Hasil ARC Prize 2025 menyoroti loop penyempurnaan sebagai kunci kemajuan AGI
2025-12-05 Tiny Recursive Model (TRM) 8.0% Hasil ARC Prize 2025 menyoroti loop penyempurnaan sebagai kunci kemajuan AGI
2025-11-18 Gemini 3 Deep Think 45.1% Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-11-18 Gemini 3 Deep Think 45.1% Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-10-06 TRM 8.0% Tiny Recursive Model (TRM) mencapai akurasi ARC-AGI lebih tinggi daripada LLM dengan 7 juta parameter
2025-09-16 Grok-4 29.4% ARC-AGI v2 SoTA ditetapkan dengan mengembangkan instruksi bahasa Inggris menggunakan Grok-4
2025-08-15 HRM 2.0% Analisis menemukan bahwa kinerja HRM pada ARC-AGI didorong oleh penyempurnaan loop luar dan hafalan
2025-08-08 Grok 4 15.9% xAI Grok 4 memimpin benchmark Arc-AGI2 dengan skor 15.9% versus GPT5
2025-07-09 Grok 4 15.9% xAI merilis Grok 4 dengan penguatan pembelajaran berskala dan penggunaan alat asli
2025-04-22 o4-mini-medium 3.0% ARC Prize Foundation mengevaluasi OpenAI o3 dan o4-mini pada benchmark ARC-AGI
2025-04-22 o4-mini-low 3.0% ARC Prize Foundation mengevaluasi OpenAI o3 dan o4-mini pada benchmark ARC-AGI
2025-04-22 o3-medium 3.0% ARC Prize Foundation mengevaluasi OpenAI o3 dan o4-mini pada benchmark ARC-AGI
2025-04-22 o3-low 3.0% ARC Prize Foundation mengevaluasi OpenAI o3 dan o4-mini pada benchmark ARC-AGI
2025-03-24 public AI reasoning systems 9.0% ARC Prize Foundation meluncurkan benchmark ARC-AGI-2 dan ARC Prize 2025
2024-12-20 o3 tuned high 87.0% OpenAI memamerkan model penalaran o3 dengan terobosan ARC AGI dan Frontier Math