一位在 Hugging Face 论坛上的本科生讨论将 VAPO 论文中的概念应用于 Qwen 2.5 Omni 3B 模型,以解决在带有幻灯片上下文的音频转录过程中出现的幻觉问题。
- VAPO 论文指出,在多模态大语言模型中展平并连接不同类型的 token 会导致视觉干扰,从而在转录文本中产生幻觉。
- VAPO 通过使用一种具有“时间解耦策略”的强化学习范式来解决此问题,该策略将视觉先验提取与转录分离开来。
- 该学生询问对 Qwen 2.5 Omni 3B 进行架构修改(例如在 thinker 块之前捕获嵌入或更改 thinker 块本身)是否可以防止视觉 token 干扰音频 token。
该帖子寻求在现有 Qwen 架构内实施这些解耦策略的技术指导。