ある開発者が、単一のRTX 4090上で動作し、特定のベンチマークでGPT-Liveに匹敵する完全ローカルかつフルデュープレックスの音声エージェントであるSpeakrailをオープンソース化した。このシステムは、音声からテキストへの変換にVoxtral Realtimeを、マイクロターン微調整済みのGemma 4 12BモデルとBreeze TTS 2を組み合わせており、割り込みやバックチャネルを含む低遅延の対話を実現する。

  • パイプラインは、Voxtral Realtimeに取り付けられたターンテイクヘッドと、 speculative LLM+TTSの発火を使用して遅延を最小化する。
  • コア言語モデルはGemma 4 12B QATであり、<interject>や<listen>などのマイクロターン制御トークンを含む合成データで微調整されている。
  • 「考えながら話す」メカニズムにより、ベースラインのGemma 4 12B int4が複雑な推論タスクのために思考ノートを書き込むことができる。
  • システムは静かなモードと割り込みモードをサポートしており、明示的なユーザー制御に基づいてモデルが聴取するか発話するかを可能にする。

このリリースは、十分なローカルハードウェアを持つユーザーにとって、クラウドベースの音声アシスタントに対するプライバシー保護型の代替手段を提供するが、現在、コンテキストの長さやTTSコンポーネントの商業利用に関する制限がある。