يقترح مستخدم في منتديات Hugging Face تجربة في النقل المعرفي التدريجي، حيث يتعلم نموذج طالب ذو حجم ثابت (Qwen 4B) بشكل تسلسلي من نماذج معلمة أكبر فأكبر بدلاً من التعلم مباشرةً من الأكبر حجماً المتاح.
- تتضمن العملية تعلم النموذج بحجم 4B من Qwen 8B أو 9B، ثم التخلي عن ذلك المعلم للتعلم من Qwen 12B، وبعدها من Qwen 27B.
- تحاكي هذه الطريقة التعلم البشري من خلال البناء على المعرفة المكتسبة سابقاً بدلاً من محاولة سد فجوة قدرات كبيرة في خطوة واحدة.
- يقترح الاقتراح استخدام طريقة مشابهة لمشروع Heretic، بتوظيف استراتيجية "البحث والتعزيز" لتحديد وإضافة القدرات المفيدة مع تجنب إعادة اكتشاف السمات التي تم تعلمها بالفعل.
- يُقاس النجاح بما إذا كان النموذج ذو الحجم الثابت قد تحسن بشكل قابل للقيام وحافظ على المكاسب السابقة، مما يوفر رؤى حول السعة المعرفية العملية للنماذج الصغيرة.
يشير المؤلف إلى أن هذه الطريقة يمكن أن تحدد ما إذا كان التراكم التدريجي للمعرفة أكثر فعالية من التمثيل المباشر (distillation) من المعلم الأكبر حجماً بالنسبة للنماذج الصغيرة.