xAI a lancé Grok Voice Transcribe 2.0, un modèle de reconnaissance vocale deux fois plus précis que la version 1.0 tout en maintenant le même prix. Construit sur le modèle fondamental audio derrière Grok Voice, il s'appuie sur un ensemble de données unique d'audio multilingue en direct et bruyant pour gérer des conditions réelles difficiles telles que des lignes téléphoniques instables et des voix concurrentes.

  • Se classe premier en précision parmi 32 modèles de streaming sur le classement public d'Artificial Analysis.
  • Améliore le taux d'erreur de mots sur les phrases courtes de 20,6 % à 6,8 %, marquant sa plus grande amélioration multilingue.
  • Devance tous les modèles testés sur l'audio téléphonique et améliore les performances sur quatre ensembles de données internes de production.
  • Détecte automatiquement la langue et gère les changements de langue en cours d'enregistrement en un seul passage pour des dizaines de langues.

La mise à jour deviendra bientôt la valeur par défaut dans l'API Speech-to-Text, la version 1.0 étant prévue pour être dépréciée dans les prochaines semaines.