A IBM lançou dois novos modelos compactos de reconhecimento de fala em inglês, com 470M de parâmetros, na família Granite Speech: `granite-speech-5.0-470m-turboctc` e `granite-speech-5.0-470m-turboctc-nc`. Esses modelos apenas de codificador alcançam velocidades de transcrição sem precedentes de mais de 12.600 RTFx em uma GPU NVIDIA H200, mantendo alta precisão.
- O modelo não comercial (`-nc`) é treinado com dados adicionais e possui licença CC-BY-NC-SA-4.0, obtendo 4,85% de WER nos conjuntos de teste públicos do OpenASR.
- O modelo licenciado sob Apache 2.0 obteve 5,00% de WER e ocupa a quinta posição em precisão no FFASR Leaderboard, sendo o mais rápido entre os dois modelos.
- Ambos os modelos utilizam uma pilha de 16 blocos Conformer com atenção por pedaços (chunkwise) e geram 12,5 tokens por segundo, oferecendo taxa de processamento mais de 20x superior à dos modelos anteriores da família Granite Speech.
- A arquitetura depende de três etapas de subsampling 2x para reduzir a taxa do espectrograma log Mel de 100 quadros por segundo para 12,5 tokens por segundo.
O novo design apenas de codificador oferece uma pequena pegada de memória, ideal para tarefas de fala para texto em dispositivos de borda, embora sacrifique capacidades como tradução de fala encontradas em modelos anteriores equipados com LM.