Hugging Face 포럼의 한 학부생은 슬라이드 컨텍스트가 있는 오디오 녹음 중 환각 문제를 해결하기 위해 VAPO 논문의 개념을 Qwen 2.5 Omni 3B 모델에 적용하는 것을 논의하고 있습니다.
- VAPO 논문은 오모다얼 대형 언어 모델에서 서로 다른 토큰 유형을 평탄화하고 연결하면 시각적 간섭이 발생하여 녹음 텍스트에 환각이 생긴다고 지적합니다.
- VAPO 는 '시간적으로 분리된 정책'을 사용하는 강화 학습 패러다임을 통해 시각적 사전 추출과 녹음을 분리함으로써 이를 해결합니다.
- 학생은 Qwen 2.5 Omni 3B 의 아키텍처 수정, 예를 들어 thinker 블록 전에 임베딩을 캡처하거나 thinker 블록 자체를 변경하는 것이 시각적 토큰이 오디오 토큰에 간섭하는 것을 방지할 수 있는지 묻습니다.
이 게시물은 기존 Qwen 아키텍처 내에서 이러한 분리 전략을 구현하기 위한 기술적 지침을 구하고 있습니다.