主题 · Research paper
lab Microsoft Research Blog · 3 天前 · 11 次浏览

微软研究院推出CARE-X:一种带有辅助监督和工具增强测量的统一胸部X射线VLM

微软研究院推出了CARE-X,这是一个研究模型,旨在通过将生成式报告撰写与校准的诊断预测相结合,解决当前放射学视觉-语言模型的不足。该系统使用强化学习(DAPO)来奖励临床正确性,并将Qwen3-VL-4B-Instruct模型与确定性测量工具配对,以评估需要精确计算的条件性能。

lab NVIDIA Research · 4 天前 · 9 次浏览

ZPPO 使用提示而非梯度来改进小型视觉语言模型的训练

研究人员引入了近端策略优化的最近发展区(ZPPO),该方法将教师知识注入提示中,而非策略梯度,以解决知识蒸馏中的脆弱性和强化学习中的漂移问题。ZPPO 为难题构建包含正确候选项的问题(BCQ)和包含错误候选项的问题(NCQ),并通过重放缓冲区循环使用这些样本,直到学生模型的准确率提升或将其淘汰。