SpaceXAI a publié Grok Voice Transcribe 2.0, un modèle de transcription vocale en texte disponible via une API hébergée, qui revendique une précision deux fois supérieure à celle de la version 1.0 pour le même prix. Le modèle cible des conditions audio difficiles telles que les lignes téléphoniques bruyantes et les voix concurrentes, fonctionnant en modes par lots et en streaming en temps réel.
- Classé premier parmi 32 modèles de streaming sur le classement Artificial Analysis utilisant le benchmark AA-WER Streaming.
- A réduit le taux d'erreur de mots (WER) de 20,6 % à 6,8 % sur des phrases courtes dans 19 langues, représentant environ 67 % d'erreurs en moins.
- Prend en charge la détection automatique de la langue et le changement de langue en cours d'enregistrement pour des dizaines de langues.
- Inclut des fonctionnalités telles que la diarisation des locuteurs, les horodatages au niveau des mots, le biais sur les termes clés et la suppression des mots comblants sans coût supplémentaire.
- Tarifié à 0,10 $ par heure pour la transcription par lots et 0,20 $ par heure pour le streaming.
Atlassian Loom a adopté l'API pour transcrire chaque vidéo de son flux de travail, citant une précision supérieure à sa solution précédente.