xAI ha lanzado Grok Voice Transcribe 2.0, un modelo de voz a texto que es el doble de preciso que la versión 1.0 mientras mantiene el mismo precio. Construido sobre el modelo base de audio detrás de Grok Voice, aprovecha un conjunto de datos único de audio multilingüe en vivo y ruidoso para manejar condiciones del mundo real desafiantes como líneas telefónicas inestables y voces competitivas.

  • Ocupa el primer lugar en precisión entre 32 modelos de streaming en el tablero de clasificación público de Artificial Analysis.
  • Mejora la tasa de error de palabras en frases cortas del 20,6% al 6,8%, marcando su mayor mejora multilingüe.
  • Lidera todos los modelos probados en audio de telefonía y mejora el rendimiento en cuatro conjuntos de datos internos de producción.
  • Detecta automáticamente el idioma y maneja cambios durante la grabación en un solo pase para docenas de idiomas.

La actualización pronto se convertirá en la predeterminada en la API de Voz a Texto, con la versión 1.0 programada para su descontinuación en las próximas semanas.