SpaceXAI ha lanzado Grok Voice Transcribe 2.0, un modelo de voz a texto disponible a través de una API alojada que afirma tener el doble de precisión que la versión 1.0 al mismo precio. El modelo está diseñado para condiciones de audio difíciles, como líneas telefónicas ruidosas y voces en competencia, y funciona tanto en modo por lotes como en transmisión en tiempo real.
- Ocupa el primer lugar entre 32 modelos de streaming en el ranking de Artificial Analysis utilizando la métrica AA-WER Streaming.
- Logró una reducción de la tasa de error de palabras del 20.6% al 6.8% en frases cortas en 19 idiomas, lo que representa aproximadamente un 67% menos de errores.
- Admite detección automática de idioma y cambio de idioma durante la grabación para decenas de idiomas.
- Incluye funciones como diarización de hablantes, marcas de tiempo a nivel de palabra, sesgo de términos clave y eliminación de palabras de relleno sin costo adicional.
- Se cobra $0.10 por hora para transcripción por lotes y $0.20 por hora para streaming.
Atlassian Loom ha adoptado la API para transcribir todos los videos en su flujo de trabajo, citando una mayor precisión que su solución anterior.