Un desarrollador ha liberado como código abierto Speakrail, un agente de voz completo y dúplex que se ejecuta en una única RTX 4090 y compite con GPT-Live en ciertas pruebas. El sistema combina Voxtral Realtime para la conversión de voz a texto, un modelo Gemma 4 12B ajustado finamente con microturnos y Breeze TTS 2 para habilitar interacciones de baja latencia con interrupciones y retroalimentación.

  • La tubería utiliza una cabeza de toma de turnos adjunta a Voxtral Realtime y el disparo especulativo de LLM+TTS para minimizar la latencia.
  • El modelo de lenguaje principal es Gemma 4 12B QAT, ajustado finamente en datos sintéticos con tokens de control de microturnos como <interject> y <listen>.
  • Un mecanismo de "pensar mientras se habla" permite que un Gemma 4 12B int4 base escriba notas de pensamiento para tareas de razonamiento complejo.
  • El sistema admite modo silencioso y modo de interrupción, permitiendo que el modelo escuche o hable según el control explícito del usuario.

El lanzamiento proporciona una alternativa que preserva la privacidad a los asistentes de voz basados en la nube para usuarios con hardware local suficiente, aunque actualmente tiene limitaciones respecto a la longitud del contexto y la licencia comercial del componente TTS.