تقدم GAIR-NLP نموذج LIMO، الذي يثبت أنه يمكن استثارة الاستدلال الرياضي المعقد بفعالية باستخدام 817 عينة تدريبية مختارة بدقة فقط. يتحدى هذا النهج الافتراض التقليدي بأن الضبط الدقيق الخاضع للإشراف يتطلب مجموعات بيانات ضخمة لتجنب الحفظ.

  • يحقق LIMO دقة بنسبة 57.1% على معيار AIME و94.8% على MATH.
  • يستخدم النموذج فقط 1% من بيانات التدريب المطلوبة للنماذج القوية السابقة القائمة على SFT.
  • يُظهر تعميماً استثنائياً خارج التوزيع، محسناً الأداء بنسبة مطلقة قدرها 40.5% عبر 10 معايير متنوعة.
  • تتفوق النتائج على النماذج المدربة على بيانات أكثر بـ 100 مرة، مما يدعم "فرضية الاستدلال الأقل هو الأكثر".

يقترح المؤلفون أن قدرات الاستدلال المتطورة تظهر عندما تستفيد النماذج الأساسية من المعرفة المُدرَّبة مسبقاً الغنية عبر قوالب إدراكية دنيا ومنسقة بدقة.