كشف مراجعة لأنظمة الاستنتاج المتقدمة من مختبرات تشمل OpenAI وDeepMind وxAI وDeepSeek وAnthropic أنه بينما يحسّن توسيع الحوسبة أثناء الاختبار الدقة، فإنه يقلل الكفاءة بشكل كبير. حدد التحليل حدود باريتو لنتائج ARC-AGI-1 لكنه لاحظ فشلاً تاماً في المعيار الأكثر تحدياً ARC-AGI-2، مما يشير إلى قيود مشتركة عبر جميع النماذج الرئيسية.

  • تعتمد أنظمة الاستنتاج الحديثة على استنتاج طويل الأمد، وإعادة تركيب المعرفة، وعيّنة CoT المتوازية لتمديد "وقت التفكير".
  • يقدم o3-medium/high من OpenAI أعلى دقة بتكلفة عالية، بينما يوفر Gemini 2.5 Flash من Google توازناً بين الدقة والتكلفة.
  • يقدم Grok 3 mini-low من xAI تحسينات متواضعة في الدقة مقارنة بـ LLMs الخالصة مع متطلبات موارد أقل.
  • لا تزال ARC-AGI-2 غير محلولة بواسطة جميع الأنظمة المختبرة، مما يشير إلى أن استراتيجيات التوسع الحالية غير كافية لتحقيق قدرات AGI المتقدمة.

تشير النتائج إلى عدم وجود فائز عالمي واحد وأن أنظمة استنتاج الذكاء الاصطناعي تفتقر إلى ملاءمة قوية للسوق مقارنة بـ LLMs الخالصة بسبب عدم اتساق واجهات برمجة التطبيقات وعوائق التبني.