Студент бакалавриата на форумах Hugging Face обсуждает применение концепций из статьи VAPO к модели Qwen 2.5 Omni 3B для решения проблем галлюцинаций при транскрипции аудио с контекстом слайдов.
- В статье VAPO выявлено, что выравнивание и конкатенация различных типов токенов в омнимодальных больших языковых моделях вызывают визуальные помехи, приводящие к галлюцинированному тексту в транскриптах.
- VAPO решает эту проблему с помощью парадигмы обучения с подкреплением, использующей «временно разделенную политику», которая отделяет извлечение визуальных приоритетов от транскрипции.
- Студент спрашивает, могут ли архитектурные модификации Qwen 2.5 Omni 3B, такие как захват эмбеддингов до блока «thinker» или изменение самого блока «thinker», предотвратить вмешательство визуальных токенов в аудио токены.
Пост ищет технические рекомендации по реализации этих стратегий разделения в рамках существующей архитектуры Qwen.