Google AI ha lanzado Gemini 3.5 Transcribe, un modelo de voz a texto disponible a través de dos puntos de conexión de API distintos: la API de Interacciones para archivos pregrabados y la API en Vivo para transmisión en tiempo real.

  • El modelo reporta una tasa promedio de error de palabras del 2,6 % para no streaming y del 4,0 % para streaming, según lo medido por Artificial Analysis.
  • El tiempo hasta la transcripción final mejora un 70 % en comparación con el modelo anterior Chirp 3.
  • La detección automática admite más de 85 idiomas, incluyendo cambios de código a mitad de frase.
  • La API en Vivo ofrece latencia inferior a un segundo, pero carece de diarización de hablantes y marcas de tiempo a nivel de palabra, que están disponibles en la API de Interacciones.
  • El modo inteligente elimina las disfluencias, pero no puede combinarse con marcas de tiempo ni con diarización.

La división entre puntos de conexión permite a los desarrolladores elegir entre streaming de baja latencia para interfaces en vivo o funciones detalladas de transcripción para el procesamiento posterior.