Un étudiant de premier cycle sur les forums Hugging Face discute de l'application des concepts du papier VAPO au modèle Qwen 2.5 Omni 3B pour résoudre les problèmes d'hallucination lors de la transcription audio avec un contexte de diapositives.

  • Le papier VAPO identifie que le aplatissement et la concaténation de différents types de tokens dans les grands modèles de langage omnimodaux causent une interférence visuelle, conduisant à du texte halluciné dans les transcriptions.
  • VAPO résout cela en utilisant un paradigme d'apprentissage par renforcement avec une 'politique temporellement découplée' qui sépare l'extraction de la priorité visuelle de la transcription.
  • L'étudiant demande si des modifications architecturales à Qwen 2.5 Omni 3B, telles que capturer les embeddings avant le bloc thinker ou modifier le bloc thinker lui-même, peuvent empêcher les tokens visuels d'interférer avec les tokens audio.

La publication cherche des conseils techniques pour mettre en œuvre ces stratégies de découplage au sein de l'architecture Qwen existante.