Hugging Face 论坛上的用户提出了一项渐进式知识转移的实验,其中固定大小的学生模型(Qwen 4B)依次从越来越大的教师模型中学习,而不是直接从最大的可用模型中学习。

  • 该过程涉及 4B 模型从 Qwen 8B 或 9B 学习,然后丢弃该教师模型,转而向 Qwen 12B 学习,随后再向 Qwen 27B 学习。
  • 这种方法模仿了人类的学习方式,通过建立在先前获得的知识之上,而不是试图在一步之内跨越巨大的能力差距。
  • 该提案建议使用类似于 Heretic 项目的方法,采用“搜索与强化”策略来识别并添加有用的能力,同时避免重新发现已经习得的特征。
  • 成功与否将通过固定大小的模型是否能有可衡量的提升并保留早期成果来衡量,从而为小模型的实际知识容量提供见解。

作者认为,这种方法可以确定渐进式知识积累是否比直接从最大的教师模型进行蒸馏对小模型更有效。