연구자들은 단일 소비자 GPU에서 스트리밍 추론을 가능하게 하면서 자연스러운 운율을 보존하는 텍스트 음성 변환 모델인 TontaubeV1을 제시했습니다. 이 시스템은 의미 있는 스트림과 음향적 정제를 분리하기 위해 12.5 Hz의 계층적 DualCodec 표현을 사용하며, 이를 통해 낮은 지연 시간 생성이 가능합니다.

  • 텍스트는 문자별로 토큰화되어 Qwen3에서 파생된 트랜스포머에 의해 처리되며 발화 길이를 예측합니다.
  • 세 개의 점진적으로 작은 트랜스포머가 음향적 정제를 추가하여 총 2.9B 파라미터를 구성합니다.
  • 겹치는 DualCodec 재구성은 인과적 디코딩을 위해 VibeVoice 잠재 공간에 매핑됩니다.
  • 이 모델은 최대 1분 길이의 참조 오디오를 허용하며 영어, 독일어 및 다국어 입력을 지원합니다.
  • 단일 RTX 5090에서 스트리밍 경로는 첫 번째 오디오까지 약 200 ms의 지연 시간을 가지며, 전체 RTF는 0.08입니다.
  • TontaubeV1은 ElevenLabs Flash v2.5와 동등한 성능을 보이며, Fish Audio S2 Pro, Gradium API, Cartesia Sonic 3보다 운율 측면에서 더 우수한 성능을 보입니다.

모델 가중치는 Tontaube 커뮤니티 모델 라이선스 1.0 하에 Hugging Face에서 공개되었습니다.