Hugging Face फोरम पर एक उपयोगकर्ता ने क्रमिक ज्ञान स्थानांतरण में एक प्रयोग का प्रस्ताव रखा है, जहां एक स्थिर-आकार का छात्र मॉडल (Qwen 4B) सबसे बड़े उपलब्ध स्रोत से सीधे सीखने के बजाय बढ़ते आकार के शिक्षक मॉडलों से क्रमिक रूप से सीखता है।

  • इस प्रक्रिया में 4B मॉडल Qwen 8B या 9B से सीखता है, फिर उस शिक्षक को त्यागकर Qwen 12B से और बाद में Qwen 27B से सीखता है।
  • यह दृष्टिकोण मानव सीखने की नकल करता है, जहां एक बड़ी क्षमता अंतर को एक ही चरण में पार करने का प्रयास करने के बजाय पहले से प्राप्त ज्ञान पर आधारित होता है।
  • प्रस्ताव में Heretic प्रोजेक्ट के समान एक विधि का उपयोग सुझाया गया है, जो "खोज और पुष्टि" रणनीति अपनाकर उपयोगी क्षमताओं की पहचान और जोड़ती है, जबकि पहले से सीखे गए गुणों के पुनः खोजने से बचती है।
  • सफलता का मापन इस बात पर किया जाएगा कि क्या स्थिर-आकार का मॉडल नापने योग्य रूप से सुधार करता है और पूर्व की उपलब्धियों को बनाए रखता है, जो छोटे मॉडलों की व्यावहारिक ज्ञान क्षमता के बारे में अंतर्दृष्टि प्रदान करेगा।

लेखक का सुझाव है कि यह विधि निर्धारित कर सकती है कि क्या ज्ञान का क्रमिक संचय छोटे मॉडलों के लिए सबसे बड़े शिक्षक से सीधे विसंयोजन (distillation) की तुलना में अधिक प्रभावी है।