연구자들은 단일 소비자용 GPU에서 스트리밍 추론을 가능하게 하면서도 자연스러운 운율을 보존하는 텍스트 음성 변환 모델인 TontaubeV1을 제시했습니다. 이 시스템은 12.5 Hz의 계층적 DualCodec 표현을 사용하여 의미 있는 스트림과 음향 보정을 분리하며, 이는 근본적으로 비인과적인 코덱의 특성에도 불구하고 인과적 디코딩을 가능하게 합니다.
- 아키텍처는 총 2.9B 파라미터를 가진 네 개의 Qwen3 기반 트랜스포머를 사용합니다: 하나는 의미 있는 스트림과 발화 길이를 예측하고, 나머지 세 개는 점진적으로 더 작은 모델로 음향 보정을 추가합니다.
- 텍스트는 문자별로 토큰화되며, 짝을 이룬 텍스트와 오디오 마커가 제한된 문맥을 통해 장편 생성을 지원합니다.
- 단일 RTX 5090에서 스트리밍 경로는 첫 번째 오디오까지 약 200 ms의 지연 시간을 가지며, 단일 입력에 대한 엔드투엔드 실시간 계수는 0.08입니다.
- 이 모델은 LLM-as-a-judge 평가에서 운율 측면에서 ElevenLabs Flash v2.5와 동등하며 Fish Audio S2 Pro, Gradium API, Cartesia Sonic 3보다 우수합니다.
이 릴리스는 높은 지각적 품질과 낮은 지연 시간을 균형 있게 맞추어 접근 가능한 하드웨어에서의 실시간 애플리케이션에 적합합니다.