AGIO फ्रेमवर्क का उपयोग करके Dolphin 3.0 Llama 3.1 8B मॉडल के एक प्रायोगिक फाइन-ट्यूनिंग रन से पता चलता है कि GPQA Diamond स्कोर प्रारंभिक वृद्धि के बाद सुधार करना बंद कर देते हैं, भले ही प्रशिक्षण हानि तेजी से गिरती रहे।

  • प्रारंभिक मॉडल ने 49/198 (24.75%) का GPQA Diamond स्कोर हासिल किया, जो चेकपॉइंट CP24 और CP36 में 60/198 तक शिखर पर पहुंचा, फिर रन के शेष भाग के दौरान 54 और 56 के बीच उतार-चढ़ाव करता रहा।
  • प्रशिक्षण में एक लर्निंग रेट शेड्यूल का उपयोग किया गया जो 1.50e-05 से शुरू हुआ, चार एपॉक्स के बाद 1.15e-05 तक कम हो गया, और उसके बाद स्थिर रहा।
  • जब बाहरी सटीकता स्थिर हुई, तो GAP जैसे आंतरिक मेट्रिक्स 0.7615 से बढ़कर 1.2999 हो गए, जो सुझाव देते हैं कि मॉडल सामान्य क्षमता प्राप्त करने के बजाय अपने चयनों के लिए अधिक दृढ़ता से प्रतिबद्ध हो रहा है।
  • लेखक ने नोट किया कि हानि में कमी और बेंचमार्क प्रदर्शन के बीच विचलन के बावजूद, "परॉट" व्यवहार में गिरावट के बिना तर्कशक्ति बनाए रखी गई।

यह प्रयोग फाइन-ट्यूनिंग के दौरान लर्निंग रेट ट्रैजेक्टरी की निगरानी के महत्व को उजागर करता है, क्योंकि निरंतर प्रशिक्षण बाहरी मूल्यांकन मेट्रिक्स में समानुपातिक सुधार नहीं लाता है।