IBM a publié deux nouveaux modèles compacts de reconnaissance vocale en anglais, comptant 470 millions de paramètres, au sein de la famille Granite Speech : `granite-speech-5.0-470m-turboctc` et `granite-speech-5.0-470m-turboctc-nc`. Ces modèles à encodeur unique atteignent des vitesses de transcription sans précédent de plus de 12 600 RTFx sur un GPU NVIDIA H200 tout en maintenant une grande précision.

  • Le modèle non commercial (`-nc`) est entraîné sur des données supplémentaires et est sous licence CC-BY-NC-SA-4.0, avec un WER de 4,85 % sur les ensembles de test publics d'OpenASR.
  • Le modèle sous licence Apache 2.0 affiche un WER de 5,00 % et se classe cinquième en précision sur le FFASR Leaderboard tout en étant l'un des deux modèles les plus rapides.
  • Les deux modèles utilisent une pile de 16 blocs Conformer avec une attention par chunk et génèrent 12,5 tokens par seconde, offrant un débit plus de 20 fois supérieur à celui des précédents modèles Granite Speech.
  • L'architecture repose sur trois étapes de sous-échantillonnage x2 pour réduire le taux du spectrogramme log Mel de 100 images par seconde à 12,5 tokens par seconde.

La nouvelle conception à encodeur unique offre une empreinte mémoire réduite, idéale pour les tâches de parole en texte sur les appareils edge, bien qu'elle sacrifie des capacités comme la traduction vocale présentes dans les modèles précédents équipés d'un LM.