알리바바의 Qwen 팀은 새로운 Qwen-Audio-3.1-Realtime-plus를 포함한 5개 모델로 구성된 오디오 스택인 Qwen-Audio-3.1을 출시했으며, 이는 추론과 도구 사용이 가능한 음성 에이전트를 위해 설계된 전이중 음성 모델입니다. 이번 출시에서는 ASR 서비스에 최대 95%의 가격 인하도 도입되었습니다.
- Qwen-Audio-3.1-Realtime-plus는 QwenCloud의 관리형 API를 통해 함수 호출, 웹 검색 및 구조화된 출력을 지원하며 262K 컨텍스트 토큰을 처리할 수 있습니다.
- 학습은 Think(M²-OPD), Act(GRPO 보상이 있는 실행 가능 환경), Speak/Coordinate라는 세 가지 계층 접근 방식을 활용합니다.
- 벤치마크 개선 사항으로는 Audio MultiChallenge가 47.12에서 52.21로 상승했고, FLEURS WER는 버전 3.0 대비 9.01에서 3.98로 감소했습니다.
- 모델은 Full-Duplex-Bench v3.0에서의 피커 비율을 0.7590에서 0.2960으로 줄였으나, 중단 정지 지연 시간은 GPT-Realtime-2의 0.383초 대비 1.116초입니다.
- 가격은 오디오 입력 토큰 1M당 $6.4, 텍스트 및 오디오 출력 토큰 1M당 $24로 책정되었습니다.
이 시스템은 모델이 대화 기록 내에서 언제 말하고, 행동하며, 응답을 조정할지 결정하도록 학습함으로써 음성 에이전트의 신뢰성을 향상시키는 것을 목표로 합니다.