Meta Superintelligence Labsは、ストリーミング自動音声認識(ASR)、20人以上の話者 diarization、およびエンドポイント検出を一度のパスで実行する単一の自己回帰モデルであるMuse Voice Transcribeをリリースしました。このモデルは、muse-voice-transcribe-1.0という名前でMeta Model API上でホストされたAPIとして利用可能です。

  • Artificial Analysis AA-WER Streamingベンチマークにおいて、0.16秒のレイテンシで最終トランスクリプトの単語誤り率3.1%を達成しています。
  • 精度と速度のバランスを取るために単語ごとに異なる適応遅延ポリシーを学習するために強化学習が使用されています。
  • 1時間を超えるオーディオ入力と、70以上の言語間のネイティブなコードスイッチングをサポートしています。
  • 価格は1,000分のオーディオあたり3.00ドルで、Cartesia Ink-2やElevenLabs Scribe v2 Realtimeなどの競合他社を下回っています。

このシステムはMeta AI for MacおよびMuse Codeのdictationを駆動し、マルチモデルスタックに関連するレイテンシと障害モードを削減する統合ソリューションを提供します。