xAI는 버전 1.0보다 정확도가 두 배 높으면서도 동일한 가격을 유지하는 음성-텍스트 모델인 Grok Voice Transcribe 2.0을 출시했습니다. Grok Voice의 오디오 파운데이션 모델 위에 구축되었으며, 불안정한 전화 회선과 경쟁하는 음성 같은 어려운 현실 세계 조건을 처리하기 위해 라이브 노이즈가 있는 다국어 오디오의 고유한 데이터셋을 활용합니다.

  • 공개 Artificial Analysis 리더보드에서 32개 스트리밍 모델 중 정확도 1위입니다.
  • 짧은 구절의 단어 오류율을 20.6%에서 6.8%로 개선하여 가장 큰 다국어 개선을 기록했습니다.
  • 전화 오디오 테스트된 모든 모델에서 선두를 차지하며 네 가지 내부 생산 데이터셋 전반에 걸쳐 성능을 개선했습니다.
  • 언어를 자동으로 감지하고 수십 개의 언어에 대해 녹음 중 전환을 단일 패스로 처리합니다.

이 업데이트는 곧 Speech-to-Text API의 기본값이 되며, 버전 1.0은 다가오는 주 내에 폐기될 예정입니다.