أصدرت IBM نموذجين جديدين صغيرين الحجم من نماذج التعرف على الكلام باللغة الإنجليزية، يتكون كل منهما من 470 مليون معامل، ضمن عائلة Granite Speech: `granite-speech-5.0-470m-turboctc` و`granite-speech-5.0-470m-turboctc-nc`. تحقق هذه النماذج التي تعتمد على التشفير فقط (encoder-only) سرعات نسخ غير مسبوقة تتجاوز 12,600 RTFx على معالج NVIDIA H200 GPU مع الحفاظ على دقة عالية.

  • النموذج غير التجاري (`-nc`) تم تدريبه على بيانات إضافية ويحمل رخصة CC-BY-NC-SA-4.0، وحصل على نسبة خطأ في الكلمات (WER) تبلغ 4.85% على مجموعات الاختبار العامة لـ OpenASR.
  • النموذج المرخص بموجب رخصة Apache 2.0 حصل على نسبة WER تبلغ 5.00% واحتل المرتبة الخامسة في الدقة على لوحة المتصدرين FFASR، بينما كان الأسرع بين النماذج.
  • يستخدم كلا النموذجين مجموعة من 16 كتلة Conformer مع انتباه متقطع (chunkwise attention)، وينتجان 12.5 رمزًا في الثانية، مما يوفر معدل معالجة أسرع بأكثر من 20 مرة مقارنة بنماذج Granite Speech السابقة.
  • يعتمد التصميم على ثلاث مراحل من تقليل العينة بمقدار الضعف (2x subsampling) لتقليل معدل طيف لوج ميل (log Mel spectrogram) من 100 إطار في الثانية إلى 12.5 رمزًا في الثانية.

يوفر التصميم الجديد المعتمد على التشفير فقط بصمة ذاكرة صغيرة مثالية لمهام تحويل الكلام إلى نص على الأجهزة الطرفية، رغم أنه يتخلى عن قدرات مثل ترجمة الكلام الموجودة في النماذج السابقة المزودة بنماذج لغوية (LM).