IBM ha lanzado dos nuevos modelos compactos de reconocimiento de voz en inglés de 470M parámetros dentro de la familia Granite Speech: `granite-speech-5.0-470m-turboctc` y `granite-speech-5.0-470m-turboctc-nc`. Estos modelos de solo codificador logran velocidades de transcripción sin precedentes de más de 12.600 RTFx en una GPU NVIDIA H200 mientras mantienen una alta precisión.

  • El modelo no comercial (`-nc`) está entrenado con datos adicionales y tiene una licencia CC-BY-NC-SA-4.0, obteniendo un WER del 4,85% en los conjuntos de prueba públicos de OpenASR.
  • El modelo con licencia Apache 2.0 obtiene un WER del 5,00% y ocupa el quinto puesto en precisión en la FFASR Leaderboard, siendo al mismo tiempo uno de los dos modelos más rápidos.
  • Ambos modelos utilizan una pila de 16 bloques Conformer con atención por fragmentos y generan 12,5 tokens por segundo, ofreciendo un rendimiento más de 20 veces superior al de los modelos anteriores de Granite Speech.
  • La arquitectura se basa en tres etapas de submuestreo 2x para reducir la tasa del espectrograma log Mel de 100 fotogramas por segundo a 12,5 tokens por segundo.

El nuevo diseño de solo codificador proporciona una huella de memoria reducida, ideal para tareas de voz a texto en dispositivos edge, aunque sacrifica capacidades como la traducción de voz presentes en modelos anteriores equipados con LM.