حقق المؤلف دقة جديدة قياسية تبلغ 50% على مجموعة الاختبار العامة لمعيار الاستدلال ARC-AGI، مستفيدًا من GPT-4o لتوليد وتقييم آلاف التطبيقات بلغة Python لكل مشكلة.

  • تولد الطريقة حوالي 8000 برنامج Python لكل مشكلة باستخدام مطالبات few-shot مع استدلال خطوة بخطوة.
  • يتم اختيار البرامج بناءً على صحتها مقابل الأمثلة المقدمة، مع نهج مجموعة لتنوع أحجام الشبكة.
  • تحاول مرحلة المراجعة إصلاح أفضل 12 تطبيقًا واعدًا عن طريق عرض مخرجاتها الفعلية وطلب التصحيحات.
  • كانت الدقة القياسية السابقة 34%، بينما يحقق البشر 85% على توزيع التدريب الأسهل.

يوضح هذا النتيجة أن نماذج اللغة الكبيرة الحالية يمكن أن تؤدي أداءً decently well (جيدًا بشكل معقول) في مهام الاستدلال المعقدة من خلال أخذ العينات المكثفة والتحقق، مما يتحدى الادعاءات بأنها تفتقر إلى قدرات التعلم أثناء الاستنتاج.