Google ha presentado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, modelos nativos de voz a voz diseñados para agentes de voz en tiempo real que razonan y ejecutan herramientas sin interrumpir el flujo conversacional.

  • Ambos modelos ya están disponibles en la API Gemini Live y Google AI Studio como soluciones alojadas.
  • Gemini 3.8 Live se centra en la escalabilidad y la eficiencia de costos, mientras que Extended Thinking añade capacidades de razonamiento en múltiples pasos.
  • Extended Thinking ocupa el puesto #1 en el Índice de Calidad de Voz a Voz de Artificial Analysis con una puntuación de 82.6.
  • Los modelos admiten llamada asíncrona de funciones, contexto visual, precisión alfanumérica y 97 idiomas.
  • El precio se establece en $0.005/min para entrada de audio y $0.018/min para salida de audio a través de la API Live.

Estos lanzamientos proporcionan una alternativa simplificada a las tuberías de voz en cascada, permitiendo a los desarrolladores construir agentes de voz de grado producción con uso integrado de herramientas y baja latencia.