SpaceXAI ने Grok Voice Transcribe 2.0 जारी किया है, जो एक स्पीच-टू-टेक्स्ट मॉडल है और होस्टेड API के माध्यम से उपलब्ध है, जिसका दावा है कि इसकी सटीकता संस्करण 1.0 की तुलना में दोगुनी है, समान मूल्य बिंदु पर। मॉडल शोर भरे फोन लाइनों और प्रतिस्पर्धी आवाज़ों जैसे कठिन ऑडियो परिस्थितियों को लक्षित करता है, जो बैच और रियल-टाइम स्ट्रीमिंग दोनों मोड में चलता है।

  • AA-WER Streaming बेंचमार्क का उपयोग करते हुए Artificial Analysis लीडरबोर्ड पर 32 स्ट्रीमिंग मॉडल्स में पहले स्थान पर।
  • 19 भाषाओं में छोटे वाक्यों पर शब्द त्रुटि दर (word error rate) को 20.6% से घटाकर 6.8% किया, जिसका अर्थ है लगभग 67% कम त्रुटियां।
  • कई भाषाओं के लिए स्वचालित भाषा पहचान और रिकॉर्डिंग के दौरान भाषा स्विचिंग का समर्थन करता है।
  • बिना किसी अतिरिक्त लागत के स्पीकर डायरिज़ेशन, शब्द-स्तरीय टाइमस्टैम्प, मुख्य शब्द बायसिंग और फिलर शब्द हटाने जैसे सुविधाएं शामिल हैं।
  • बैच ट्रांसक्रिप्शन के लिए प्रति घंटे $0.10 और स्ट्रीमिंग के लिए प्रति घंटे $0.20 पर मूल्य निर्धारित किया गया है।

Atlassian Loom ने अपने वर्कफ़्लो में हर वीडियो को ट्रांसक्राइब करने के लिए इस API को अपनाया है, जिसका कारण उसकी पिछली समाधान की तुलना में उच्च सटीकता बताया गया है।