Um estudante de graduação nos fóruns do Hugging Face discute a aplicação de conceitos do artigo VAPO ao modelo Qwen 2.5 Omni 3B para abordar problemas de alucinação durante a transcrição de áudio com contexto de slides.

  • O artigo VAPO identifica que achatamento e concatenação de diferentes tipos de tokens em Modelos de Linguagem Grande omnimodais causam interferência visual, levando a texto alucinado nas transcrições.
  • O VAPO resolve isso usando um paradigma de aprendizado por reforço com uma 'politicamente desacoplada temporalmente' que separa a extração da prioridade visual da transcrição.
  • O estudante pergunta se modificações arquiteturais no Qwen 2.5 Omni 3B, como capturar embeddings antes do bloco thinker ou alterar o próprio bloco thinker, podem impedir que tokens visuais interfiram com tokens de áudio.

A postagem busca orientação técnica para implementar essas estratégias de desacoplamento dentro da arquitetura Qwen existente.