研究人员提出了Masters,一种用于将大规模视觉-语言模型蒸馏为适合边缘部署的紧凑版本的掩码渐进式强化学习框架。该方法解决了因师生模型尺寸差距导致的不稳定性问题。

  • Masters对教师的非主导权重进行掩码以降低复杂度,然后在训练过程中逐步恢复容量以实现更平滑的学习。
  • 它集成了使用来自掩码教师预生成响应的离线RL阶段,避免了在线思考-回答范式的计算成本。
  • 该框架采用两种互补的奖励:用于响应正确性的准确性奖励和量化转移容易程度的蒸馏奖励。

这种方法使学生能够利用丰富而高效的指导实现强大的性能,而无需冗长的响应生成过程。