نشرت مؤسسة جائزة ARC تحليلها العام الأول لنماذج OpenAI o3 و o4-mini على معايير الاستدلال ARC-AGI. يكشف التقييم أنه بينما تُظهر هذه النماذج المتقدمة تقدماً ملحوظاً، إلا أنها لم تحل بعد مجموعة ARC-AGI-2 الصعبة.
- حقق o3-medium نسبة 53% على مجموعة ARC-AGI-1 Semi Private Eval، بينما وصل o4-mini-medium إلى 41% بكفاءة عالية.
- سجل كل من o3 و o4-mini أقل من 3% على معيار ARC-AGI-2 الأكثر تحدياً.
- أدت إعدادات الاستدلال العالية إلى تغطية غير مكتملة بسبب تجاوز الوقت أو فقدان المخرجات، مما يجعل هذه النتائج غير مناسبة للإبلاغ عن القوائم المتصدرة.
- يختلف نموذج o3 الإنتاجي عن الإصدار السابق o3-preview بدمج المدخلات البصرية واستخدام قيود بيانات تدريب مختلفة.
تسلط النتائج الضوء على أن ARC-AGI-1 يبقى أداة حساسة لقياس قدرات النماذج الحالية، بينما يعمل ARC-AGI-2 كمعيار للأجيال القادمة للنماذج التي تغلق الفجوة بين الاستدلال البشري والذكاء الاصطناعي.