أطلق مختبر تونغوي التابع لشركة علي بابا نظام Qwen-Audio-3.0-TTS، وهو نظام مستضاف لتحويل النص إلى كلام، متوفر بنسختين: فلاش للتفاعل في الوقت الفعلي، وبلاس للجيل عالي الجودة. يتم تقديم كلتا الطبقتين عبر منصة Alibaba Cloud Model Studio بدلاً من أوزان قابلة للتنزيل.

  • يدعم النموذج 16 لغة و20 منطقة لهجة صينية، حيث حقق فلاش أدنى متوسط لمعدل خطأ الكلمات/الأحرف بنسبة 3.87.
  • يحتل Qwen-Audio-3.0-TTS-Plus المرتبة الأولى على لوحة المتصدرين لتحويل النص إلى كلام من Artificial Analysis بنتيجة إيلو تقارب 1,236.
  • يتضمن النظام 86 علامة مضمنة دقيقة التفاصيل للسمات غير اللفظية مثل الضحك والتنفس، جنباً إلى جنب مع التحكم في الأسلوب بلغة طبيعية.
  • يستهدف فلاش زمن تأخير للحزمة الأولى يبلغ 300 مللي ثانية، بينما يركز بلاس على دقة النبرة وتشابه المتحدثين، متقدماً في المرتبة الأولى عبر جميع اللغات الست عشرة.

يوفر هذا الإصدار للمطورين قدرات قوية للتركيب متعدد اللغات وتحكماً دقيقاً في الصوت عبر واجهة برمجة تطبيقات مستضافة.