xAI ने Grok Voice Transcribe 2.0 जारी किया है, जो एक स्पीच-टू-टेक्स्ट मॉडल है और वजन 1.0 की तुलना में दोगुना सटीक है जबकि समान मूल्य बनाए हुए है। यह Grok Voice के पीछे वाले ऑडियो फाउंडेशन मॉडल पर निर्मित है, जो चुनौतीपूर्ण वास्तविक दुनिया की स्थितियों जैसे कि अस्थिर फोन लाइनों और प्रतिस्पर्धी आवाज़ों को संभालने के लिए लाइव, शोर वाले बहुभाषी ऑडियो के एक अनूठे डेटासेट का लाभ उठाता है।
- पब्लिक Artificial Analysis लीडरबोर्ड पर 32 स्ट्रीमिंग मॉडल के बीच सटीकता में पहले स्थान पर है।
- छोटे वाक्यों पर शब्द त्रुटि दर को 20.6% से घटाकर 6.8% कर दिया है, जो इसकी सबसे बड़ी बहुभाषी सुधार है।
- टेलीफोनी ऑडियो पर प्रत्येक परीक्षण किए गए मॉडल में अग्रणी है और चार आंतरिक उत्पादन डेटासेट पर प्रदर्शन में सुधार किया है।
- भाषा का स्वचालित रूप से पता लगाता है और दर्जनों भाषाओं के लिए रिकॉर्डिंग के बीच में बदलाव को एक ही पास में संभालता है।
यह अपडेट जल्द ही स्पीच-टू-टेक्स्ट API में डिफ़ॉल्ट बन जाएगा, और 1.0 वर्जन आने वाली हफ्तों में निष्क्रिय होने की योजना है।