أطلقت كارتيسيا Sonic-3.6، أحدث إصدار من نموذجها لتحويل النص إلى كلام في الوقت الفعلي، والذي يحتل الآن المركز الأول على كلتا لوحتي المتصدرين للكلام في تحليل الذكاء الاصطناعي. يركز التحديث على تحسين الطبيعة ويستخدم نماذج الفضاء الحالة بدلاً من المحولات لتحقيق زمن أول صوت أقل من 90 مللي ثانية.

  • يحقق Sonic-3.6 نتيجة 1,283 إيلو على لوحة صوت المزود و1,283 إيلو على لوحة الصوت الخاضع للتحكم.
  • النموذج متاح في النسخة التجريبية عبر واجهة برمجة التطبيقات المستضافة من كارتيسيا، لكنه لا يوفر أوزانًا يمكن استضافتها ذاتيًا.
  • تشمل الميزات الرئيسية للإنتاج وسوم التعبير المضمنة، واستنساخ الصوت الفوري من 10 ثوانٍ من الصوت، ودعم الأرقام والحروف الأبجدية الأصلي.
  • تطبيع تحليل الذكاء الاصطناعي للسعر عند 49.00 دولار لكل مليون حرف، وهو نصف تكلفة ElevenLabs Eleven v3.

يوفر الإصدار حلاً للبث المباشر لتحويل النص إلى كلام قابل للنشر تجاريًا يوازن بين زمن الاستجابة المنخفض والطبيعة العالية للتطبيقات مثل دعم العملاء وترجمة الوسائط.