Microsoft AIは、初のストリーミング音声からテキストへの変換モデルであるMAI-Transcribe-2-Streamingをリリースしました。このモデルは、Artificial AnalysisのAA-WER Streamingインデックスにおいて38モデル中1位を獲得しています。2026年10月1日に公開され、60言語に対応し、連続的な自動言語検出機能を備え、音声エージェントやライブキャプションを対象としています。
- 最終的な文字起こし(レイテンシ0.13秒)と最初の部分文字起こし(レイテンシ0.12秒)の両方で、2.5%の単語誤り率(WER)を達成。
- 音声入力を受けてから約100ミリ秒以内に初期推論結果を出力するため、エージェントが文の途中でも推論を行うことが可能。
- 2026年末までの導入期間中、料金は時間あたり0.54ドル。
- Realtime API(WebSocket)およびAzure Speech SDKを通じて利用可能で、MAI PlaygroundやVercelとの統合も提供。
最終的な文字起こしと同等の精度で部分文字起こしを提供するこのモデルの能力により、レイテンシが重要なアプリケーションにおいてリアルタイムの対話が可能になります。