अलibaba के क्वेन टीम ने क्वेन-ऑडियो-3.1 जारी किया है, जो एक पांच-मॉडल ऑडियो स्टैक है जिसमें नया क्वेन-ऑडियो-3.1-रियलटाइम-प्लस शामिल है, जो वॉइस एजेंट्स के लिए डिज़ाइन किया गया एक फुल-डप्लेक्स स्पीच मॉडल है जो तर्क और टूल उपयोग की क्षमता रखता है। इस रिलीज़ में ASR सेवाओं पर 95% तक की कीमत में कमी भी शामिल है।
- क्वेन-ऑडियो-3.1-रियलटाइम-प्लस क्वेनक्लाउड पर मैनेज्ड API के माध्यम से फंक्शन कॉलिंग, वेब खोज और स्ट्रक्चर्ड आउटपुट के साथ 262K कॉन्टेक्सट टोकन का समर्थन करता है।
- प्रशिक्षण में तीन-स्तरीय दृष्टिकोण का उपयोग किया जाता है: सोचें (M²-OPD), कार्य करें (GRPO पुरस्कारों के साथ एक्जीक्यूटेबल वातावरण), और बोलें/समन्वय करें।
- बेंचमार्क में सुधार शामिल हैं: ऑडियो मल्टीचैलेंज 47.12 से बढ़कर 52.21 हो गया है और FLEURS WER संस्करण 3.0 की तुलना में 9.01 से घटकर 3.98 हो गया है।
- मॉडल ने फुल-डप्लेक्स-बेंच v3.0 पर फिलर दरों को 0.7590 से घटाकर 0.2960 कर दिया है, हालाँकि इंटर्रप्शन स्टॉप लेटेंसी GPT-रियलटाइम-2 के 0.383 के मुकाबले 1.116 सेकंड है।
- कीमत निर्धारित है: ऑडियो इनपुट टोकन प्रति 1M के लिए $6.4 और टेक्स्ट व ऑडियो आउटपुट टोकन प्रति 1M के लिए $24।
सिस्टम का उद्देश्य मॉडल्स को संवाद इतिहास में बोलने, कार्य करने और प्रतिक्रियाओं का समन्वय करने के समय निर्णय लेना सिखाकर वॉइस एजेंट्स की विश्वसनीयता में सुधार करना है।