Microsoft AI는 38개 모델 중 Artificial Analysis AA-WER Streaming 인덱스에서 1위를 차지하는 첫 번째 스트리밍 음성-텍스트 변환 모델인 MAI-Transcribe-2-Streaming을 출시했습니다. 2026년 10월 1일 출시된 이 모델은 연속 자동 언어 감지 기능을 통해 60개 언어를 전사하며, 음성 에이전트와 실시간 자막을 타겟으로 합니다.

  • 최종 전사본(지연 시간 0.13초)과 첫 번째 부분 전사본(지연 시간 0.12초) 모두에서 2.5%의 단어 오류율(WER)을 달성합니다.
  • 오디오 수신 후 약 100ms 이내에 초기 가설을 생성하여 에이전트가 문장 중간에서도 추론할 수 있게 합니다.
  • 2026년 말까지의 도입 기간 동안 시간당 $0.54의 비용을 책정합니다.
  • Realtime API(WebSocket)와 Azure Speech SDK를 통해 제공되며, MAI Playground 및 Vercel에서 통합됩니다.

이 모델은 최종 전사본과 동일한 정확도의 부분 전사본을 제공할 수 있어 지연 시간이 중요한 애플리케이션에서 실시간 상호작용을 가능하게 합니다.