GAIR-NLP ने LIMO पेश किया है, एक मॉडल जो यह प्रदर्शित करता है कि जटिल गणितीय तर्क को केवल 817 चयनित प्रशिक्षण नमूनों का उपयोग करके प्रभावी ढंग से उत्पन्न किया जा सकता है। यह दृष्टिकोण इस परंपरागत मान्यता को चुनौती देता है कि मेमोरीकरण से बचने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग को विशाल डेटासेट की आवश्यकता होती है।

  • LIMO ने AIME बेंचमार्क पर 57.1% सटीकता और MATH पर 94.8% हासिल किया है।
  • मॉडल पिछले मजबूत SFT-आधारित मॉडलों द्वारा आवश्यक प्रशिक्षण डेटा का केवल 1% उपयोग करता है।
  • यह अपवादजनक आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण प्रदर्शित करता है, 10 विविध बेंचमार्क्स में 40.5 निरपेक्ष सुधार लाता है।
  • परिणाम 100 गुना अधिक डेटा पर प्रशिक्षित मॉडलों को पछाड़ते हैं, जो "कम-है-ज्यादा तर्क परिकल्पना" का समर्थन करते हैं।

लेखकों ने सुझाव दिया है कि जटिल तर्क क्षमताएं तब उभरती हैं जब फाउंडेशन मॉडल न्यूनतम, सटीक रूप से संरेखित संज्ञानात्मक टेम्पलेट्स के माध्यम से समृद्ध पूर्व-प्रशिक्षित ज्ञान का लाभ उठाते हैं।