शोधकर्ताओं ने एडुआर्डो का परिचय दिया, जो एक मल्टी-टर्न रिनफोर्समेंट लर्निंग रेसिपी है जो लार्ज लैंग्वेज मॉडल ट्यूटरों को प्रशिक्षित करने के लिए उपयोग की जाती है और यह "असिस्टेंस डिलेमा" को संबोधित करती है जहां मॉडल सिखाने के बजाय उत्तर देने की प्रवृत्ति रखते हैं। विधि में एक मस्क्ड नियर-ट्रांसफर पोस्ट-टेस्ट और बाइनरी रिवार्ड गेट्स का उपयोग किया जाता है ताकि कॉग्निटिव ऑफलोडिंग को कम किया जा सके और समाधान हस्तांतरण से रोका जा सके।

  • दृष्टिकोण निरंतर पेनल्टी की जगह दो बाइनरी रिवार्ड गेट्स से लेता है: ट्यूटर प्रतिक्रिया का तथ्यात्मक सटीकता और कोई समाधान हस्तांतरण नहीं।
  • एक लीव-वन-आउट एब्लेशन पुष्टि करता है कि जबकि लर्निंग-गेन रिवार्ड्स अकेले सिखाने को बताने से अलग नहीं करते, गेट्स हस्तांतरण को कम करते हैं और पोस्ट-टेस्ट आउट-ऑफ-डोमेन ट्रांसफर को बेहतर बनाता है।
  • एडुआर्डो दो भिन्न LLM आर्किटेक्चर्स से 4B, 9B, 14B, और 27B मॉडल प्रशिक्षित करता है।
  • पोस्ट-ट्रेन किए गए एडुआर्डो-27B मॉडल मैथट्यूटरबेंच पर गेमिनी-3.1-प्रो के बराबर और ट्यूटरमोमेंट्स पर क्लॉड ओपस 4.8 के बराबर है, जबकि इसने 2.4-6.2x कम थिंकिंग टोकन का उपयोग किया।
  • प्रशिक्षण के दौरान सपोर्ट फेडिंग तकनीकों को बाहर करते हुए मॉडल ने पश-फॉर-जस्टिफिकेशन टीचर मुव का उपयोग दोगुना से अधिक कर दिया है।

टीम ने इंटरैक्टिव ट्यूटिंग में आगे की विकास को सुगम बनाने के लिए प्रशिक्षण वातावरण, 8,671-समस्याओं वाला नियर-ट्रांसफर डेटासेट और प्रशिक्षित मॉडल ओपन-सोर्स किए हैं।