أطلقت فريق كوين التابع لألبابا مجموعة نماذج صوتية مكونة من خمسة نماذج، تشمل Qwen-Audio-3.1-Realtime-plus الجديد، وهو نموذج كلام ثنائي الاتجاه مصمم لوكلاء الصوت القادرين على الاستدلال واستخدام الأدوات. كما يتضمن الإطلاق تخفيضات في الأسعار تصل إلى 95% على خدمات التعرف التلقائي على الكلام (ASR).

  • يدعم Qwen-Audio-3.1-Realtime-plus سياقاً مكوناً من 262K رمزاً مع استدعاء الوظائف، والبحث عبر الويب، والمخرجات المهيكلة عبر واجهة برمجة التطبيقات المُدارة على QwenCloud.
  • يعتمد التدريب نهجاً ثلاثي الطبقات: التفكير (M²-OPD)، والتصرف (بيئات قابلة للتنفيذ مع مكافآت GRPO)، والكلام/التنسيق.
  • تشمل التحسينات في المعايير ارتفاع Audio MultiChallenge من 47.12 إلى 52.21، وانخفاض معدل الخطأ في الكلمات (WER) في FLEURS من 9.01 إلى 3.98 مقارنة بالإصدار 3.0.
  • يقلل النموذج من معدلات الحشو في Full-Duplex-Bench v3.0 من 0.7590 إلى 0.2960، على الرغم من أن زمن توقف المقاطعة هو 1.116 ثانية مقابل 0.383 لـ GPT-Realtime-2.
  • تُحدد الأسعار عند 6.4 دولار لكل مليون رمز إدخال صوتي، و24 دولاراً لكل مليون رمز إخراج للنص والصوت.

يهدف النظام إلى تحسين موثوقية وكلاء الصوت من خلال تدريب النماذج على تحديد متى تتحدث، وتتصرف، وتنسق الردود ضمن سياق المحادثة.