IBM은 Granite Speech 계열에 두 개의 새로운 경량 470M 파라미터 영어 음성 인식 모델을 출시했습니다: `granite-speech-5.0-470m-turboctc`와 `granite-speech-5.0-470m-turboctc-nc`. 인코더 전용 모델은 NVIDIA H200 GPU에서 높은 정확도를 유지하면서 12,600 RTFx 이상의 전례 없는 변환 속도를 달성합니다.

  • 비상업용 모델(`-nc`)은 추가 데이터로 학습되었으며 CC-BY-NC-SA-4.0 라이선스를 따르며, OpenASR 공개 테스트 세트에서 WER 4.85%를 기록했습니다.
  • Apache 2.0 라이선스를 가진 모델은 WER 5.00%를 기록하며 FFASR 리더보드에서 정확도 부문 5위를 차지했고, 가장 빠른 두 모델 중 하나입니다.
  • 두 모델 모두 청크 단위 어텐션이 적용된 16개의 Conformer 블록 스택을 사용하며 초당 12.5토큰을 생성하여 이전 Granite Speech 모델보다 20배 이상 빠른 처리량을 제공합니다.
  • 아키텍처는 로그 멜 스펙트로그램의 주파수를 초당 100프레임에서 초당 12.5토큰으로 줄이기 위해 3단계의 2x 서샘플링에 의존합니다.

새로운 인코더 전용 설계는 엣지 장치에서의 음성-텍스트 작업에 이상적인 작은 메모리 사용량을 제공하지만, 이전 LM 탑재 모델에서 발견된 음성 번역과 같은 기능은 희생됩니다.