अलीबाबा की टोंगी लैब ने Qwen-Audio-3.0-TTS जारी किया है, जो एक होस्टेड टेक्स्ट-टू-स्पीच सिस्टम है जो दो वेरिएंट में उपलब्ध है: रियल-टाइम इंटरैक्शन के लिए फ्लैश और हाई-क्वालिटी जनरेशन के लिए प्लस। दोनों स्तर अलीबाबा क्लाउड मॉडल स्टूडियो के माध्यम से डिलीवर किए जाते हैं, डाउनलोडेबल वेट्स के रूप में नहीं।
- मॉडल 16 भाषाओं और 20 चीनी बोलियों के क्षेत्रों का समर्थन करता है, जिसमें फ्लैश ने शब्द/अक्षर त्रुटि दर में सबसे कम औसत 3.87 हासिल किया।
- Qwen-Audio-3.0-TTS-Plus आर्टिफिशियल एनालिसिस टेक्स्ट-टू-स्पीच लीडरबोर्ड पर 1,236 के करीब ईलो स्कोर के साथ पहले स्थान पर है।
- सिस्टम में हंसी और सांस लेने जैसे गैर-कथित विवरणों के लिए 86 सूक्ष्म इनलाइन टैग शामिल हैं, साथ ही नेचुरल-लैंग्वेज स्टाइल कंट्रोल भी है।
- फ्लैश का लक्ष्य 300 ms का पहला पैकेट लेटेंसी है, जबकि प्लस टिम्बर फिडेलिटी और स्पीकर समानता पर ध्यान केंद्रित करता है, जो सभी 16 भाषाओं में शीर्ष स्थान पर है।
इस रिलीज ने डेवलपर्स को एक होस्टेड API के माध्यम से मजबूत बहुभाषी सिंथेसिस क्षमताओं और सूक्ष्म ऑडियो कंट्रोल प्रदान किया है।