Benchmark · reasoning

ARC-AGI 2

33 نتائج 28 نماذج

يقيس ARC-AGI 2 (Abstraction & Reasoning Corpus، الإصدار 2، ويُقام باسم ARC Prize 2025) الاستدلال المرن: استنتاج قاعدة مجردة من أمثلة قليلة وتطبيقها على حالة جديدة. الدرجة هي النسبة المئوية للألغاز التي تُحَل بشكل صحيح على مجموعة تقييم محجوزة وشبه خاصة.

اقرأ المزيد
مثال
تعرض المهمة بضعة أزواج من المدخلات→المخرجات على هيئة شبكات ملوّنة (شبكة صغيرة من خلايا ملوّنة جرى تحويلها بطريقة متسقة واحدة)، وعلى من يحل أن يستنتج التحويل الخفي وينتج شبكة المخرجات الصحيحة لمدخل جديد.
طريقة التقييم
يُقيَّم كل لغز بنجاح/فشل: تُقارن شبكة المخرجات الناتجة بالشبكة الصحيحة تماماً، والدرجة المعلنة هي النسبة المئوية للألغاز المحلولة على مجموعة التقييم شبه الخاصة.
التحقق
تُتحقَّق النتائج تلقائياً عبر التطابق التام لشبكة المخرجات — إذ يجب أن تطابق الشبكة المتوقَّعة الإجابةَ خلية بخلية — على مجموعة اختبار شبه خاصة لا تُنشَر للعموم لمنع الحفظ عن ظهر قلب.
لماذا يهم
يركّز على ألغاز سهلة على البشر لكنها صعبة على AI، لذا فهو مقياس يُتابَع عن كثب للتجريد الحقيقي والاستدلال العام، وليس للمعرفة المحفوظة.
مثال محلول
المهمة
أحجية شبكة ARC-AGI-2: استنتج التحويل من أزواج التدريب، ثم أعطِ شبكة الخرج لمدخل الاختبار (الأرقام 0–9 ألوان؛ 0 = خلفية سوداء). التدريب 1: [[4,0,0,0],[0,0,6,0],[4,0,0,0],[0,0,6,0]] → [[0,0,0,0],[0,0,0,0],[4,0,6,0],[4,0,6,0]]. التدريب 2: [[0,3,0,0],[0,0,0,8],[0,3,0,0],[0,0,0,0]] → [[0,0,0,0],[0,0,0,0],[0,3,0,0],[0,3,0,8]]. الاختبار: [[0,0,2,0],[5,0,0,0],[0,0,2,0],[5,0,0,0]] → ?
الحل
[[0, 0, 0, 0], [0, 0, 0, 0], [5, 0, 2, 0], [5, 0, 2, 0]]
الشرح
يُظهر كل زوج تدريبي القاعدة نفسها — 'الجاذبية': تسقط كل خلية ملوّنة رأسيًا إلى أدنى الخلايا الفارغة في عمودها، مع الحفاظ على لونها وعددها، بينما ترتفع الخلفية (0) إلى الأعلى. في الاختبار، يستقر الرقمان 5 في العمود 0 والرقمان 2 في العمود 2 في الصفّين السفليين. يُقيّم ARC-AGI-2 بالمطابقة التامة للشبكة — الأبعاد الصحيحة وقيمة كل خلية — وفق تسجيل pass@2 على محاولتين مسموح بهما.
0 25 50 75 100 2024-12-20 2025-10-11 2026-08-03 o3 tuned high · 87 · 2024-12-20 public AI reasoning systems · 9 · 2025-03-24 o4-mini-medium · 3 · 2025-04-22 o4-mini-low · 3 · 2025-04-22 o3-medium · 3 · 2025-04-22 o3-low · 3 · 2025-04-22 Grok 4 · 15.9 · 2025-07-09 Grok 4 · 15.9 · 2025-08-08 HRM · 2 · 2025-08-15 Grok-4 · 29.4 · 2025-09-16 TRM · 8 · 2025-10-06 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 84.6 · 2026-02-12 Gemini 3 Pro (Poetiq refinement) · 54 · 2025-12-05 NVARC (fine-tuned 4B model variant) · 27.6 · 2025-12-05 Poetiq's system (Gemini-based configuration) · 54 · 2025-12-05 Opus 4.5 (Thinking, 64k) · 37.6 · 2025-12-05 Tiny Recursive Model (TRM) · 8 · 2025-12-05 GPT-5.2 Thinking · 52.9 · 2025-12-11 GPT-5.2 Thinking · 52.9 · 2025-12-11 Claude Opus 4.6 · 68.8 · 2026-02-05 Claude Opus 4.6 · 69 · 2026-04-16 Gemini 3.1 Pro · 77.1 · 2026-02-19 Imbue’s Darwinian Evolver · 95.1 · 2026-04-16 Confluence Lab · 97.9 · 2026-04-16 Gemini 3 “Deep Think” · 84.6 · 2026-04-16 GPT-5.4 Pro · 83.3 · 2026-04-16 GPT-5.2 · 53 · 2026-04-16 GPT-5.5 · 85 · 2026-04-25 Gemini 3 Pro · 54 · 2026-07-06 GPT-5.2 Pro · 54.2 · 2026-07-06 Inkling-Small · 40.1 · 2026-08-03
o3 tuned high public AI reasoning systems o4-mini-medium o4-mini-low o3-medium o3-low Grok 4 HRM Grok-4 TRM Gemini 3 Deep Think Gemini 3 Pro (Poetiq refinement) NVARC (fine-tuned 4B model variant) Poetiq's system (Gemini-based configuration) Opus 4.5 (Thinking, 64k) Tiny Recursive Model (TRM) GPT-5.2 Thinking Claude Opus 4.6 Gemini 3.1 Pro Imbue’s Darwinian Evolver Confluence Lab Gemini 3 “Deep Think” GPT-5.4 Pro GPT-5.2 GPT-5.5 Gemini 3 Pro GPT-5.2 Pro Inkling-Small
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-08-03 Inkling-Small 40.1% مختبر الآلات المفكرة يُصدر Inkling-Small، وهو نموذج MoE متعدد الوسائط بوزن مفتوح يتكون من 276 مليار معلمة
2026-07-06 Gemini 3 Pro 54.0% بحث مدفوع بالوسائط مع حكم تتبع شامل لـ ARC-AGI-2
2026-07-06 GPT-5.2 Pro 54.2% بحث مدفوع بالوسائط مع حكم تتبع شامل لـ ARC-AGI-2
2026-04-25 GPT-5.5 85.0% OpenAI تطلق GPT-5.5، نموذج مُعاد تدريبه من الصفر مع معالجة أومني مودال أصلية
2026-04-16 Imbue’s Darwinian Evolver 95.1% GPT-5.2 يحقق ~53% على معيار ARC-AGI-2 في ديسمبر 2025
2026-04-16 Confluence Lab 97.9% GPT-5.2 يحقق ~53% على معيار ARC-AGI-2 في ديسمبر 2025
2026-04-16 Gemini 3 “Deep Think” 84.6% GPT-5.2 يحقق ~53% على معيار ARC-AGI-2 في ديسمبر 2025
2026-04-16 GPT-5.4 Pro 83.3% GPT-5.2 يحقق ~53% على معيار ARC-AGI-2 في ديسمبر 2025
2026-04-16 GPT-5.2 53.0% GPT-5.2 يحقق ~53% على معيار ARC-AGI-2 في ديسمبر 2025
2026-04-16 Claude Opus 4.6 69.0% GPT-5.2 يحقق ~53% على معيار ARC-AGI-2 في ديسمبر 2025
2026-02-19 Gemini 3.1 Pro 77.1% جوجل تطلق Gemini 3.1 Pro مع تحسينات في الاستدلال
2026-02-12 Gemini 3 Deep Think 84.6% جوجل تطلق نسخة مطورة من Gemini 3 Deep Think بنتائج معايير جديدة
2026-02-05 Claude Opus 4.6 68.8% أنثروبيك تطلق كلاود أوبوس 4.6 بنافذة سياق بـ 1 مليون وتطبيقات عميلية محسّنة
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI تطرح GPT-5.2 بقدرات محسّنة للبرمجة والسياق الطويل والاستدلال
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI تطلق GPT-5.2، متفوقة على Gemini 3 في معايير البرمجة والاستدلال
2025-12-05 Gemini 3 Pro (Poetiq refinement) 54.0% نتائج جائزة ARC 2025 تسلط الضوء على حلقات التحسين كعامل رئيسي لتقدم الذكاء العام الاصطناعي
2025-12-05 NVARC (fine-tuned 4B model variant) 27.64% باحثو إنفيديا يفوزون بجائزة Kaggle ARC Prize 2025 باستدلال AGI فعال من حيث التكلفة
2025-12-05 Poetiq's system (Gemini-based configuration) 54.0% Poetiq تحقق 54% على ARC-AGI-2 بنصف التكلفة باستخدام نظام فرعي
2025-12-05 Opus 4.5 (Thinking, 64k) 37.6% نتائج جائزة ARC 2025 تسلط الضوء على حلقات التحسين كعامل رئيسي لتقدم الذكاء العام الاصطناعي
2025-12-05 Tiny Recursive Model (TRM) 8.0% نتائج جائزة ARC 2025 تسلط الضوء على حلقات التحسين كعامل رئيسي لتقدم الذكاء العام الاصطناعي
2025-11-18 Gemini 3 Deep Think 45.1% جوجل تطلق Gemini 3 Pro بقدرات استدلال متعددة الوسائط متقدمة
2025-11-18 Gemini 3 Deep Think 45.1% جوجل تطلق Gemini 3 Pro بقدرة reasoning متعددة الوسائط متقدمة
2025-10-06 TRM 8.0% نموذج TRM المتكرر الصغير يحقق دقة ARC-AGI أعلى من نماذج LLM بـ 7 ملايين معلمة
2025-09-16 Grok-4 29.4% تحقيق SoTA لـ ARC-AGI v2 من خلال تطوير تعليمات اللغة الإنجليزية باستخدام Grok-4
2025-08-15 HRM 2.0% تحليل يكشف أن أداء HRM على ARC-AGI مدفوع بتحسين الحلقة الخارجية والحفظ
2025-08-08 Grok 4 15.9% Grok 4 من xAI يتصدر معيار Arc-AGI2 بنتيجة 15.9% مقابل GPT5
2025-07-09 Grok 4 15.9% xAI تطلق Grok 4 بتعلم التعزيز المقيّد واستخدام الأدوات الأصلي
2025-04-22 o4-mini-medium 3.0% مؤسسة جائزة ARC تقيّم نماذج OpenAI o3 و o4-mini على معايير ARC-AGI
2025-04-22 o4-mini-low 3.0% مؤسسة جائزة ARC تقيّم نماذج OpenAI o3 و o4-mini على معايير ARC-AGI
2025-04-22 o3-medium 3.0% مؤسسة جائزة ARC تقيّم نماذج OpenAI o3 و o4-mini على معايير ARC-AGI
2025-04-22 o3-low 3.0% مؤسسة جائزة ARC تقيّم نماذج OpenAI o3 و o4-mini على معايير ARC-AGI
2025-03-24 public AI reasoning systems 9.0% مؤسسة جائزة ARC تطلق معيار ARC-AGI-2 وجائزة ARC 2025
2024-12-20 o3 tuned high 87.0% OpenAI تستعرض نموذج o3 للاستدلال مع إنجازات في ARC AGI و Frontier Math