IBM telah merilis dua model pengenalan ucapan bahasa Inggris baru yang ringkas, masing-masing memiliki 470 juta parameter, dalam keluarga Granite Speech: `granite-speech-5.0-470m-turboctc` dan `granite-speech-5.0-470m-turboctc-nc`. Model encoder-only ini mencapai kecepatan transkripsi yang belum pernah terjadi sebelumnya, yaitu lebih dari 12.600 RTFx pada GPU NVIDIA H200 sambil mempertahankan akurasi tinggi.
- Model non-komersial (`-nc`) dilatih dengan data tambahan dan menggunakan lisensi CC-BY-NC-SA-4.0, mencatatkan WER sebesar 4,85% pada set pengujian publik OpenASR.
- Model dengan lisensi Apache 2.0 mencatatkan WER sebesar 5,00% dan menempati peringkat kelima dalam akurasi di FFASR Leaderboard sambil menjadi dua model tercepat.
- Kedua model menggunakan tumpukan 16 blok Conformer dengan perhatian chunkwise dan menghasilkan 12,5 token per detik, menawarkan throughput lebih dari 20 kali lebih cepat dibandingkan model Granite Speech sebelumnya.
- Arsitektur ini mengandalkan tiga tahap subsampling 2x untuk mengurangi laju spektrum log Mel dari 100 frame per detik menjadi 12,5 token per detik.
Desain encoder-only yang baru memberikan jejak memori kecil yang ideal untuk tugas ucapan-ke-teks pada perangkat tepi, meskipun mengorbankan kemampuan seperti terjemahan ucapan yang terdapat pada model sebelumnya yang dilengkapi LM.