Hugging Face フォーラムの学部生が、スライドコンテキスト付きの音声文字起こし中の幻覚問題に対処するため、VAPO 論文の概念を Qwen 2.5 Omni 3B モデルに適用することについて議論しています。
- VAPO 論文は、オムニモーダル大規模言語モデルにおいて異なるトークンタイプを平坦化して連結することが視覚的干渉を引き起こし、文字起こしテキストに幻覚を生じさせると特定しています。
- VAPO は、「時間的に分離されたポリシー」を用いた強化学習パラダイムにより、視覚的事前抽出と文字起こしを分離することでこれを解決します。
- 学生は、thinker ブロックの前の埋め込みを取得するか、thinker ブロック自体を変更するなど、Qwen 2.5 Omni 3B のアーキテクチャ修正が、視覚トークンが音声トークンに干渉するのを防ぐことができるかどうかを尋ねています。
この投稿は、既存の Qwen アーキテクチャ内でこれらの分離戦略を実装するための技術的なガイダンスを求めています。