मेटा सुपरइंटेलिजेंस लैब्स ने म्यूज़ वॉयस ट्रांसक्राइब जारी किया है, जो एकल ऑटोरेग्रेसिव मॉडल है जो स्ट्रीमिंग ऑटोमैटिक स्पेच रिकग्निशन (ASR), 20+ बोलने वालों के लिए स्पीकर डायरिज़ेशन और एंडपॉइंटिंग को एक ही पास में करता है। मॉडल मेटा मॉडल API पर 'muse-voice-transcribe-1.0' नाम से होस्टेड API के रूप में उपलब्ध है।
- यह आर्टिफिशियल एनालिसिस AA-WER स्ट्रीमिंग बेंचमार्क पर 0.16s लेटेंसी पर 3.1% अंतिम-ट्रांसक्राइब वर्ड एरर रेट हासिल करता है।
- रीइन्फोर्समेंट लर्निंग एक एडेप्टिव डिले पॉलिसी को प्रशिक्षित करता है जो सटीकता और गति के बीच संतुलन बनाने के लिए शब्द के अनुसार भिन्न होता है।
- मॉडल एक घंटे से अधिक की ऑडियो इनपुट और 70+ भाषाओं में नेटिव कोड-स्विचिंग का समर्थन करता है।
- मूल्य $3.00 प्रति 1,000 ऑडियो मिनट है, जो कार्टेशिया Ink-2 और एलेवनलैब्स Scribe v2 Realtime जैसे प्रतिस्पर्धियों की तुलना में कम है।
यह सिस्टम मेटा AI for Mac और म्यूज़ कोड में डिक्टेशन को संचालित करता है, जो लेटेंसी और मल्टी-मॉडल स्टैक से जुड़ी विफलताओं को कम करने वाला एक एकीकृत समाधान प्रदान करता है।