أعلنت تيانتسنت عن إتاحة نموذج الأساس AuK لتوليد الكلام وتحريره كمصدر مفتوح، بما في ذلك الكود والأوزان على منصتي Hugging Face وModelScope. يتضمن الإصدار متغير AuK-Flash المضغوط المصمم للاستدلال السريع بخطوات فقط 4.

  • AuK هو نموذج بـ 1.5 مليار معلمة تم تدريبه على ملايين الساعات من بيانات الصوت.
  • يدعم تحويل النص إلى كلام بدون تدريب (zero-shot TTS)، وتحرير المحتوى والصوتيات، والتحرير ما وراء اللغوي، وتحسين الكلام، وفصل المصادر عبر تعليمات باللغة الطبيعية.
  • يوفر المستودع الأوزان الرسمية لكل من النموذج الأساسي والمتغير السريع AuK-Flash.
  • تم توفير أمثلة للتثبيت والاستخدام لمنصتي Hugging Face وModelScope.

يتيح الإصدار للمطورين الوصول إلى واجهة موحدة لمهام الكلام المتعددة بموجب رخصة MIT.