أعلنت تيانتسنت عن إتاحة نموذج الأساس AuK لتوليد الكلام وتحريره كمصدر مفتوح، بما في ذلك الكود والأوزان على منصتي Hugging Face وModelScope. يتضمن الإصدار متغير AuK-Flash المضغوط المصمم للاستدلال السريع بخطوات فقط 4.
- AuK هو نموذج بـ 1.5 مليار معلمة تم تدريبه على ملايين الساعات من بيانات الصوت.
- يدعم تحويل النص إلى كلام بدون تدريب (zero-shot TTS)، وتحرير المحتوى والصوتيات، والتحرير ما وراء اللغوي، وتحسين الكلام، وفصل المصادر عبر تعليمات باللغة الطبيعية.
- يوفر المستودع الأوزان الرسمية لكل من النموذج الأساسي والمتغير السريع AuK-Flash.
- تم توفير أمثلة للتثبيت والاستخدام لمنصتي Hugging Face وModelScope.
يتيح الإصدار للمطورين الوصول إلى واجهة موحدة لمهام الكلام المتعددة بموجب رخصة MIT.