研究人员引入了近端策略优化的最近发展区(ZPPO),该方法将教师知识注入提示中,而非策略梯度,以解决知识蒸馏中的脆弱性和强化学习中的漂移问题。ZPPO 为难题构建包含正确候选项的问题(BCQ)和包含错误候选项的问题(NCQ),并通过重放缓冲区循环使用这些样本,直到学生模型的准确率提升或将其淘汰。
- ZPPO 在 BCQ 中将一个正确的教师回答与一个错误的学生回答配对以强制区分,而 NCQ 则聚合学生的失败案例以揭示共同的错误模式。
- 该方法在 Qwen3.5 系列模型上进行了测试,规模从 0.8B 到 9B,并使用了一个 27B 的教师模型。
- 评估涵盖了一个包含 16 个 VLM、10 个 LLM 和 5 个视频任务的 31 项基准测试套件。
- ZPPO 优于离策略/在线策略蒸馏和 GRPO,且在最小模型规模下观察到的提升最大。
通过将教师保留在提示中而非策略梯度中,ZPPO 避免了破坏在线策略假设,同时放大了学生当前最近发展区内的学习。