一名开发者开源了 Speakrail,这是一个完全本地化、全双工的语音代理,可在单张 RTX 4090 上运行,并在某些基准测试中与 GPT-Live 相媲美。该系统结合使用 Voxtral Realtime 进行语音转文本、经过微轮次微调的 Gemma 4 12B 模型以及 Breeze TTS 2,以实现支持插话和反馈的低延迟交互。

  • 该流水线将轮次控制头附加到 Voxtral Realtime 上,并采用推测性 LLM+TTS 触发机制以最小化延迟。
  • 核心语言模型为 Gemma 4 12B QAT,使用带有 <interject> 和 <listen> 等微轮次控制标记的合成数据进行微调。
  • “边说边想”机制允许基础版 Gemma 4 12B int4 为复杂推理任务撰写思维笔记。
  • 系统支持静音模式和中断模式,允许模型根据用户的明确控制进行监听或发言。

该发布为拥有足够本地硬件的用户提供了一种保护隐私的云端语音助手替代方案,但目前其在上下文长度和 TTS 组件的商业许可方面仍存在局限性。