Seorang mahasiswa sarjana di forum Hugging Face membahas penerapan konsep dari makalah VAPO ke model Qwen 2.5 Omni 3B untuk mengatasi masalah halusinasi selama transkripsi audio dengan konteks slide.
- Makalah VAPO mengidentifikasi bahwa meratakan dan menggabungkan berbagai jenis token dalam Model Bahasa Besar omnimodal menyebabkan interferensi visual, yang menghasilkan teks halusinasi dalam transkrip.
- VAPO menyelesaikan ini menggunakan paradigma pembelajaran penguatan dengan 'kebijakan yang terpisah secara temporal' yang memisahkan ekstraksi prior visual dari transkripsi.
- Mahasiswa tersebut bertanya apakah modifikasi arsitektur pada Qwen 2.5 Omni 3B, seperti menangkap embedding sebelum blok thinker atau mengubah blok thinker itu sendiri, dapat mencegah token visual mengganggu token audio.
Postingan ini mencari panduan teknis untuk menerapkan strategi pemisahan ini di dalam arsitektur Qwen yang ada.