Компания IBM выпустила две новые компактные модели распознавания английской речи из семейства Granite Speech, содержащие по 470 миллионов параметров: `granite-speech-5.0-470m-turboctc` и `granite-speech-5.0-470m-turboctc-nc`. Эти модели с исключительно энкодером достигают беспрецедентной скорости транскрипции более 12600 RTFx на графическом процессоре NVIDIA H200, сохраняя при этом высокую точность.
- Некоммерческая модель (`-nc`) обучена на дополнительных данных и распространяется под лицензией CC-BY-NC-SA-4.0, демонстрируя показатель WER 4,85% на публичных тестовых наборах OpenASR.
- Модель с лицензией Apache 2.0 показывает результат WER 5,00% и занимает пятое место по точности в таблице лидеров FFASR, оставаясь при этом самой быстрой из двух моделей.
- Обе модели используют стек из 16 блоков Conformer с чанковой внимательностью и генерируют 12,5 токенов в секунду, обеспечивая пропускную способность более чем в 20 раз быстрее по сравнению с предыдущими моделями Granite Speech.
- Архитектура опирается на три этапа подвыборки (subsampling) с коэффициентом 2x, что снижает частоту логарифмического мел-спектрограммы с 100 кадров в секунду до 12,5 токенов в секунду.
Новый дизайн исключительно на энкодере обеспечивает небольшой объем потребляемой памяти, что идеально подходит для задач преобразования речи в текст на периферийных устройствах, хотя и жертвует такими возможностями, как перевод речи, присутствовавшими в предыдущих моделях с языковой моделью.