主题 · Training methods
lab NVIDIA Research · 4 天前 · 9 次浏览

ZPPO 使用提示而非梯度来改进小型视觉语言模型的训练

研究人员引入了近端策略优化的最近发展区(ZPPO),该方法将教师知识注入提示中,而非策略梯度,以解决知识蒸馏中的脆弱性和强化学习中的漂移问题。ZPPO 为难题构建包含正确候选项的问题(BCQ)和包含错误候选项的问题(NCQ),并通过重放缓冲区循环使用这些样本,直到学生模型的准确率提升或将其淘汰。