Google AI ha lanzado Gemini 3.5 Transcribe, un modelo de voz a texto disponible a través de dos puntos de conexión de API distintos: la API de Interacciones para archivos pregrabados y la API en Vivo para transmisión en tiempo real.
- El modelo reporta una tasa promedio de error de palabras del 2,6 % para no streaming y del 4,0 % para streaming, según lo medido por Artificial Analysis.
- El tiempo hasta la transcripción final mejora un 70 % en comparación con el modelo anterior Chirp 3.
- La detección automática admite más de 85 idiomas, incluyendo cambios de código a mitad de frase.
- La API en Vivo ofrece latencia inferior a un segundo, pero carece de diarización de hablantes y marcas de tiempo a nivel de palabra, que están disponibles en la API de Interacciones.
- El modo inteligente elimina las disfluencias, pero no puede combinarse con marcas de tiempo ni con diarización.
La división entre puntos de conexión permite a los desarrolladores elegir entre streaming de baja latencia para interfaces en vivo o funciones detalladas de transcripción para el procesamiento posterior.