IBM发布了Granite Speech系列中的两款新型紧凑型470M参数英语语音识别模型:`granite-speech-5.0-470m-turboctc`和`granite-speech-5.0-470m-turboctc-nc`。这些仅编码器模型在NVIDIA H200 GPU上实现了前所未有的超过12,600 RTFx的转录速度,同时保持高精度。
- 非商业模型(`-nc`)使用额外数据训练,采用CC-BY-NC-SA-4.0许可证,在OpenASR公开测试集上的WER得分为4.85%。
- Apache 2.0许可证的模型WER得分为5.00%,在FFASR排行榜上准确率排名第五,同时是速度最快的两个模型之一。
- 两款模型均使用16层Conformer块堆叠结构,结合分块注意力机制,每秒生成12.5个token,吞吐量比之前的Granite Speech模型快20倍以上。
- 该架构依赖三级2倍下采样,将对数梅尔频谱图速率从每秒100帧降低到每秒12.5个token。
新的仅编码器设计提供了较小的内存占用,非常适合边缘设备上的语音转文本任务,但牺牲了先前配备语言模型的能力,如语音翻译。