Un estudiante de pregrado en los foros de Hugging Face discute aplicar conceptos del artículo VAPO al modelo Qwen 2.5 Omni 3B para abordar problemas de alucinación durante la transcripción de audio con contexto de diapositivas.

  • El artículo VAPO identifica que aplanar y concatenar diferentes tipos de tokens en Modelos de Lenguaje Grande omnimodales causa interferencia visual, llevando a texto alucinado en las transcripciones.
  • VAPO resuelve esto utilizando un paradigma de aprendizaje por refuerzo con una 'política temporalmente desacoplada' que separa la extracción de la prioridad visual de la transcripción.
  • El estudiante pregunta si las modificaciones arquitectónicas a Qwen 2.5 Omni 3B, como capturar embeddings antes del bloque thinker o alterar el propio bloque thinker, pueden evitar que los tokens visuales interfieran con los tokens de audio.

La publicación busca orientación técnica para implementar estas estrategias de desacoplamiento dentro de la arquitectura Qwen existente.