يقدم التقرير التقني لـ AuK نموذجًا أساسيًا مفتوح المصدر يوحّد توليف الكلام وتحريره من خلال تعليمات اللغة الطبيعية والسياق الصوتي.

  • تم تدريب النموذج على حوالي 3.03 مليار مثيل لتعليمات-صوت و1.95 مليون ساعة من الإشراف عبر خمس عائلات مهام.
  • تجمع البنية بين نموذج لغوي كبير متعدد الوسائط، وVAE للتشغيل الصوتي، ومحول هجين لتدفق مستقيم (rectified-flow).
  • تشمل ما بعد التدريب تحسين التفضيلات بناءً على ملاحظات البشر والتعلم المعزز القائم على المكافأة.
  • يحقق AuK-Flash استنتاجًا في 4 خطوات مع تسريع في الوقت الفعلي بنسبة 4.5 مرة مقارنة بالنموذج الكامل.

أصدر المؤلفون الشفرة المصدرية وأوزان النموذج لدعم إمكانية التكرار والبحث الإضافي.