알리바바의 Qwen 팀은 오디오-비디오 이해와 도구 사용을 위해 에이전트 기능을 중심으로 설계된 최초의 올모달 모델인 Qwen3.8-Omni-Flash를 출시했습니다. 이 모델은 텍스트, 이미지, 오디오, 비디오 입력을 받아 텍스트 출력을 반환하며, 1M 토큰 컨텍스트 윈도우와 네이티브 함수 호출 기능을 갖추고 있습니다.

  • Qwen3.8-Flash-Next 아키텍처를 기반으로 하며, 최대 991K 입력 토큰과 최대 131K 출력 토큰을 지원하는 1M 토큰 컨텍스트를 제공합니다.
  • 긴 비디오를 위한 에이전트 지각 워크플로우를 채택하여 OmniVideoBench 정확도를 63.4에서 67.8로 높이고 토큰 사용량을 45.7% 줄였습니다.
  • Qwen3.5-Omni-Plus 대비 상당한 성능 향상을 보였으며, 29개 평가 항목에서 평균 점수가 25% 이상 향상되었습니다.
  • QwenCloud, 알리바바 클라우드 Model Studio, Qwen Studio를 통해 API로 제공되며, 가격은 입력 토큰 1M당 $0.15, 출력 토큰 1M당 $0.47입니다.
  • 팀은 멀티모달 에이전트 허브를 지원하기 위해 Apache-2.0 라이선스 하에 Qwen-MM-Plugins를 오픈소스로 공개했습니다.

이번 출시는 긴 형식의 오디오 및 비디오 분석이 포함된 복잡한 에이전트 워크플로우를 위한 호스팅 솔루션을 제공하며, 이전 모델 대비 오디오-비디오 입력 비용이 93% 이상 절감된 것으로 보고되었습니다.