Студент бакалавриата на форумах Hugging Face обсуждает применение концепций из статьи VAPO к модели Qwen 2.5 Omni 3B для решения проблем галлюцинаций при транскрипции аудио с контекстом слайдов.

  • В статье VAPO выявлено, что выравнивание и конкатенация различных типов токенов в омнимодальных больших языковых моделях вызывают визуальные помехи, приводящие к галлюцинированному тексту в транскриптах.
  • VAPO решает эту проблему с помощью парадигмы обучения с подкреплением, использующей «временно разделенную политику», которая отделяет извлечение визуальных приоритетов от транскрипции.
  • Студент спрашивает, могут ли архитектурные модификации Qwen 2.5 Omni 3B, такие как захват эмбеддингов до блока «thinker» или изменение самого блока «thinker», предотвратить вмешательство визуальных токенов в аудио токены.

Пост ищет технические рекомендации по реализации этих стратегий разделения в рамках существующей архитектуры Qwen.