Google ha lanzado Gemini 3.5 Transcribe, un modelo de voz a texto diseñado para interacciones de voz inteligentes que convierte audio sin procesar en texto preciso y pulido, manejando el ruido de fondo y las disfluencias.

  • Alcanza una Tasa de Error de Palabra (WER) promedio del 4.0% para streaming y del 2.6% para casos de uso no en streaming según Artificial Analysis.
  • Mejora el tiempo hasta la transcripción final en un 70% en comparación con el modelo anterior Chirp 3.
  • Admite más de 85 idiomas con detección automática y maneja vocabulario personalizado para jerga especializada.
  • Ofrece transmisión en tiempo real a través de Live API y procesamiento de audio pregrabado a través de Interactions API.
  • Permite la llamada de funciones para delegar tareas como la generación de imágenes a otros modelos Gemini.

El modelo está disponible en vista previa pública a través de Gemini API, Google AI Studio y la plataforma Gemini Enterprise Agent Platform.