한 개발자가 단일 RTX 4090에서 실행되며 일부 벤치마크에서 GPT-Live에 필적하는 완전 로컬, 풀듀플렉스 음성 에이전트인 Speakrail을 오픈소스로 공개했습니다. 이 시스템은 음성-텍스트 변환을 위해 Voxtral Realtime, 마이크로 턴 파인튜닝된 Gemma 4 12B 모델, 그리고 Breeze TTS 2를 결합하여 인터럽션과 백채널이 가능한 저지연 상호작용을 가능하게 합니다.
- 파이프라인은 Voxtral Realtime에 연결된 턴 테이킹 헤드와 지연 시간을 최소화하기 위한 추론 기반 LLM+TTS 발화를 사용합니다.
- 핵심 언어 모델은 <interject> 및 <listen>과 같은 마이크로 턴 제어 토큰을 사용하여 합성 데이터로 파인튜닝된 Gemma 4 12B QAT입니다.
- "말하면서 생각하기" 메커니즘은 복잡한 추론 작업을 위해 기본 Gemma 4 12B int4가 사고 노트를 작성할 수 있도록 합니다.
- 이 시스템은 명시적인 사용자 제어에 따라 모델이 듣거나 말하도록 하는 조용한 모드와 인터럽트 모드를 지원합니다.
이번 릴리스는 충분한 로컬 하드웨어를 갖춘 사용자를 위해 클라우드 기반 음성 비서에 대한 프라이버시를 보호하는 대안을 제공하지만, 현재 컨텍스트 길이와 TTS 구성 요소의 상업적 라이선싱 측면에서 제한사항이 있습니다.