메타 슈퍼인텔리전스 랩스는 스트리밍 자동 음성 인식(ASR), 20명 이상의 화자 분할, 그리고 엔드포인트 검출을 한 번의 처리로 수행하는 단일 자기회귀 모델을 출시한 뮤즈 보이스 트랜스크라이브를 발표했습니다. 이 모델은 메타 모델 API를 통해 muse-voice-transcribe-1.0이라는 이름으로 호스팅된 API 형태로 제공됩니다.

  • Artificial Analysis AA-WER Streaming 벤치마크에서 0.16초의 지연 시간과 함께 3.1%의 최종 전사 단어 오류율을 달성했습니다.
  • 적응형 지연 정책을 훈련하는 강화학습은 정확도와 속도를 균형 있게 맞추기 위해 단어마다 다른 지연을 적용합니다.
  • 이 모델은 1시간을 초과하는 오디오 입력과 70개 이상의 언어 간 네이티브 코드 전환을 지원합니다.
  • 가격은 1,000분당 $3.00로, Cartesia Ink-2 및 ElevenLabs Scribe v2 Realtime와 같은 경쟁사보다 저렴합니다.

이 시스템은 메타 AI for Mac과 뮤즈 코드에서 필기 입력 기능을 지원하며, 지연 시간과 다중 모델 스택의 실패 모드를 줄이는 통합 솔루션을 제공합니다.