Meta Superintelligence Labs telah merilis Muse Voice Transcribe, sebuah model autoregresif tunggal yang melakukan pengenalan suara otomatis (ASR) secara streaming, diarisasi pembicara untuk lebih dari 20 pembicara, dan penentuan batas akhir dalam satu langkah. Model ini tersedia sebagai API terhosting di Meta Model API dengan nama muse-voice-transcribe-1.0.
- Mencapai tingkat kesalahan kata transkrip akhir sebesar 3,1% dengan latensi 0,16s pada benchmark Artificial Analysis AA-WER Streaming.
- Pembelajaran penguatan melatih kebijakan penundaan adaptif yang bervariasi per kata untuk menyeimbangkan akurasi dan kecepatan.
- Model ini mendukung input audio melebihi satu jam dan pengalihan kode asli di lebih dari 70 bahasa.
- Harganya adalah $3,00 per 1.000 menit audio, mengalahkan pesaing seperti Cartesia Ink-2 dan ElevenLabs Scribe v2 Realtime.
Sistem ini mendukung dikte di Meta AI untuk Mac dan Muse Code, menawarkan solusi terpadu yang mengurangi latensi dan mode kegagalan yang terkait dengan tumpukan multi-model.