Benchmark · reasoning

ARC-AGI 1

27 نتائج 25 نماذج

يقيس ARC-AGI 1 التفكير التجريدي والتعميم: تعرض كل مهمة بضعة أمثلة على شبكات «مدخل→مخرج»، وعلى مَن يحل المهمة أن يستنتج قاعدة التحويل الخفية وينتج شبكة المخرج الصحيحة لمدخل جديد. المقياس هو النسبة المئوية للمهام التي حُلّت بشبكة مخرج مطابقة تمامًا.

اقرأ المزيد
مثال
قد تعرض المهمة شبكتين أو ثلاث شبكات ملوّنة صغيرة يتحوّل فيها كل مدخل إلى مخرجه وفق القاعدة نفسها — مثل ملء كل منطقة مغلقة أو عكس شكل كالمرآة — وعليك تطبيق هذه القاعدة المستنتَجة على شبكة جديدة لم تُرَ من قبل.
طريقة التقييم
لا تُحتسب المهمة محلولة إلا إذا طابقت الشبكة المنتَجة الإجابة المرجعية خلية بخلية؛ والنتيجة النهائية هي نسبة (النسبة المئوية) المهام المحلولة في كامل مجموعة التقييم.
التحقق
التحقق آلي ودقيق: تُقارَن شبكة المخرج المُرسَلة بالشبكة الصحيحة خلية بخلية، بلا درجات جزئية ولا تصويت بشري.
لماذا يهم
صُمّمت الألغاز لتكون سهلة على البشر وصعبة على النماذج التي تعتمد على أنماط محفوظة، لذا يختبر هذا المعيار التجريد الحقيقي والتعميم من أمثلة قليلة بدلاً من استرجاع المعرفة — ما يجعله مقياسًا يُتابَع عن كثب لقياس التقدّم نحو ذكاء اصطناعي أكثر عمومية.
مثال محلول
المهمة
يعرض ARC-AGI 1 بضعة أمثلة على شبكات مدخل→مخرج ثم مدخلاً اختبارياً محجوباً؛ عليك استنتاج التحويل ورسم شبكة المخرج بدقة (الخلايا ألوان 0-9، 0=أسود). تكشف الأمثلة عن قاعدة ذاتية التفرّع (fractal): كل شبكة 3×3 تتوسّع إلى 9×9، إذ تُطبع نسخة من الشبكة كاملة حيث تكون الخلية ملوّنة، وكتلة 3×3 فارغة حيث تساوي 0. مدخل الاختبار (3×3): 0 8 0 / 8 8 8 / 0 8 0 (علامة زائد باللون 8).
الحل
0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0 0 8 0 0 8 0 0 8 0 8 8 8 8 8 8 8 8 8 0 8 0 0 8 0 0 8 0 0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0
الشرح
خلايا اللون 8 تقع في منتصفات الأضلاع الأربعة وفي مركز علامة الزائد؛ طبع علامة الزائد في هذه الكتل الخمس 3×3 بالضبط (وترك الأركان الأربعة فارغة) يبني الشكل الكسوري المتكرر 9×9. لا يمنح ARC-AGI الدرجة إلا عند التطابق التام خلية بخلية — خطأ في خلية واحدة يُفشل المهمة، مع السماح بمحاولتين على الأكثر.
0 24.5 49 73.5 98 2024-06-17 2025-05-17 2026-04-16 GPT-4o · 50 · 2024-06-17 MindsAI · 55.5 · 2024-12-06 Sonnet 3.5.1 · 53.6 · 2024-12-06 MIT & Cornell team · 47.5 · 2024-12-18 Claude Sonnet 3.5 · 53.6 · 2024-12-18 o3 tuned low · 76 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75 · 2026-04-16 o3-preview (low) · 75.7 · 2025-04-20 o3-preview (high) · 87.5 · 2025-04-20 o3-preview-low · 76 · 2025-04-22 o4-mini-medium · 41 · 2025-04-22 o4-mini-low · 21 · 2025-04-22 o3-medium · 53 · 2025-04-22 o3-low · 41 · 2025-04-22 o3-preview-high · 88 · 2025-04-22 HRM · 32 · 2025-08-15 Grok-4 · 79.6 · 2025-09-16 TRM · 45 · 2025-10-06 Tiny Recursive Model (TRM) · 45 · 2025-12-05 CompressARC · 20 · 2025-12-05 GPT-5.2 Pro · 90.5 · 2025-12-11 GPT-5.2 Thinking · 86.2 · 2025-12-11 Opus 4.6 · 93 · 2026-03-09 OpenAI o3 (low compute) · 75.7 · 2024-12-20 OpenAI o3 (high compute) · 87.5 · 2024-12-20
GPT-4o MindsAI Sonnet 3.5.1 MIT & Cornell team Claude Sonnet 3.5 o3 tuned low o3 o3-preview (low) o3-preview (high) o3-preview-low o4-mini-medium o4-mini-low o3-medium o3-low o3-preview-high HRM Grok-4 TRM Tiny Recursive Model (TRM) CompressARC GPT-5.2 Pro GPT-5.2 Thinking Opus 4.6 OpenAI o3 (low compute) OpenAI o3 (high compute)
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-04-16 o3 75.0% GPT-5.2 يحقق ~53% على معيار ARC-AGI-2 في ديسمبر 2025
2026-03-09 Opus 4.6 93.0% مسح يكشف عن انخفاض في الأداء بمقدار 2-3 مرات على معايير ARC-AGI رغم انخفاض التكلفة 390 مرة
2025-12-11 GPT-5.2 Pro 90.5% OpenAI تطلق GPT-5.2، متفوقة على Gemini 3 في معايير البرمجة والاستدلال
2025-12-11 GPT-5.2 Thinking 86.2% OpenAI تطرح GPT-5.2 بقدرات محسّنة للبرمجة والسياق الطويل والاستدلال
2025-12-05 Tiny Recursive Model (TRM) 45.0% نتائج جائزة ARC 2025 تسلط الضوء على حلقات التحسين كعامل رئيسي لتقدم الذكاء العام الاصطناعي
2025-12-05 CompressARC 20.0% نتائج جائزة ARC 2025 تسلط الضوء على حلقات التحسين كعامل رئيسي لتقدم الذكاء العام الاصطناعي
2025-10-06 TRM 45.0% نموذج TRM المتكرر الصغير يحقق دقة ARC-AGI أعلى من نماذج LLM بـ 7 ملايين معلمة
2025-09-16 Grok-4 79.6% تحقيق SoTA لـ ARC-AGI v2 من خلال تطوير تعليمات اللغة الإنجليزية باستخدام Grok-4
2025-08-15 HRM 32.0% تحليل يكشف أن أداء HRM على ARC-AGI مدفوع بتحسين الحلقة الخارجية والحفظ
2025-04-22 o3-preview-low 76.0% مؤسسة جائزة ARC تقيّم نماذج OpenAI o3 و o4-mini على معايير ARC-AGI
2025-04-22 o4-mini-medium 41.0% مؤسسة جائزة ARC تقيّم نماذج OpenAI o3 و o4-mini على معايير ARC-AGI
2025-04-22 o4-mini-low 21.0% مؤسسة جائزة ARC تقيّم نماذج OpenAI o3 و o4-mini على معايير ARC-AGI
2025-04-22 o3-medium 53.0% مؤسسة جائزة ARC تقيّم نماذج OpenAI o3 و o4-mini على معايير ARC-AGI
2025-04-22 o3-low 41.0% مؤسسة جائزة ARC تقيّم نماذج OpenAI o3 و o4-mini على معايير ARC-AGI
2025-04-22 o3-preview-high 88.0% مؤسسة جائزة ARC تقيّم نماذج OpenAI o3 و o4-mini على معايير ARC-AGI
2025-04-20 o3-preview (low) 75.7% تحقق o3 من OpenAI نتائج أقل على FrontierMath مما أُعلن في البداية
2025-04-20 o3-preview (high) 87.5% تحقق o3 من OpenAI نتائج أقل على FrontierMath مما أُعلن في البداية
2024-12-20 o3 tuned low 76.0% OpenAI تستعرض نموذج o3 للاستدلال مع إنجازات في ARC AGI و Frontier Math
2024-12-20 o3 75.7% OpenAI o3 يحقق نتائج قياسية في ARC-AGI-Pub
2024-12-20 o3 75.7% OpenAI تطلق نموذج o3 بأداء عالٍ في الاستدلال والبرمجة
2024-12-20 OpenAI o3 (low compute) 75.7% ARC Prize
2024-12-20 OpenAI o3 (high compute) 87.5% ARC Prize
2024-12-18 MIT & Cornell team 47.5% جيري برمان وفريق MIT/كورنيل يحققان حالة فنية جديدة على ARC-AGI-Pub
2024-12-18 Claude Sonnet 3.5 53.6% جيري برمان وفريق MIT/كورنيل يحققان حالة فنية جديدة على ARC-AGI-Pub
2024-12-06 MindsAI 55.5% نشر الفائزين بجائزة ARC Prize 2024؛ ارتفع السوتّا (SOTA) على ARC-AGI-1 إلى 55.5%
2024-12-06 Sonnet 3.5.1 53.6% جيري بيرمان يحقق 53.6% على ARC-AGI-Pub باستخدام Sonnet 3.5 مع الحوسبة التطورية أثناء الاختبار
2024-06-17 GPT-4o 50.0% GPT-4o يحقق SoTA بنسبة 50% على ARC-AGI عبر أخذ عينات ضخمة