يقدم التقرير التقني لـ AuK نموذجًا أساسيًا مفتوح المصدر يوحّد توليف الكلام وتحريره من خلال تعليمات اللغة الطبيعية والسياق الصوتي.
- تم تدريب النموذج على حوالي 3.03 مليار مثيل لتعليمات-صوت و1.95 مليون ساعة من الإشراف عبر خمس عائلات مهام.
- تجمع البنية بين نموذج لغوي كبير متعدد الوسائط، وVAE للتشغيل الصوتي، ومحول هجين لتدفق مستقيم (rectified-flow).
- تشمل ما بعد التدريب تحسين التفضيلات بناءً على ملاحظات البشر والتعلم المعزز القائم على المكافأة.
- يحقق AuK-Flash استنتاجًا في 4 خطوات مع تسريع في الوقت الفعلي بنسبة 4.5 مرة مقارنة بالنموذج الكامل.
أصدر المؤلفون الشفرة المصدرية وأوزان النموذج لدعم إمكانية التكرار والبحث الإضافي.