Um desenvolvedor lançou como código aberto o Speakrail, um agente de voz full-duplex e totalmente local que roda em uma única RTX 4090 e rivaliza com o GPT-Live em certos benchmarks. O sistema combina Voxtral Realtime para fala-para-texto, um modelo Gemma 4 12B finetuned com microturnos e Breeze TTS 2 para permitir interações de baixa latência com interrupções e retroalimentações.

  • O pipeline usa uma cabeça de tomada de turno acoplada ao Voxtral Realtime e disparo especulativo de LLM+TTS para minimizar a latência.
  • O modelo de linguagem principal é o Gemma 4 12B QAT, finetuned em dados sintéticos com tokens de controle de microturno como <interject> e <listen>.
  • Um mecanismo de "pensar enquanto fala" permite que um Gemma 4 12B int4 base escreva notas de raciocínio para tarefas complexas de inferência.
  • O sistema suporta modo silencioso e modo de interrupção, permitindo que o modelo ouça ou fale com base no controle explícito do usuário.

O lançamento oferece uma alternativa que preserva a privacidade aos assistentes de voz baseados em nuvem para usuários com hardware local suficiente, embora atualmente tenha limitações quanto ao comprimento do contexto e à licença comercial do componente TTS.