AuC तकनीकी रिपोर्ट एक ओपन-सोर्स मौलिक मॉडल का परिचय देती है जो प्राकृतिक-भाषा निर्देशों और ऑडियो संदर्भ के माध्यम से वक्ता उत्पादन और संपादन को एकीकृत करता है।

  • मॉडल को लगभग 3.03 बिलियन निर्देश-ऑडियो उदाहरणों और पांच कार्य परिवारों में 1.95 मिलियन घंटे की निगरानी पर प्रशिक्षित किया गया है।
  • आर्किटेक्चर में एक बहुआयामी बड़ा भाषा मॉडल, ध्वनि शर्तबद्ध के लिए एक VAE, और एक हाइब्रिड रेक्टिफाइड-फ्लो Transformer शामिल हैं।
  • पोस्ट-प्रशिक्षण में मानव-फीडबैक प्राथमिकता अनुकूलन और पुरस्कार-आधारित प्रबलन शिक्षा शामिल है।
  • AuK-Flash पूरे मॉडल की तुलना में 4.5 गुना दीवार-घड़ी गति बढ़ाने के साथ 4-चरण अनुमान प्राप्त करता है।

लेखकों ने पुनरुत्पादकता और आगे के शोध का समर्थन करने के लिए स्रोत कोड और मॉडल भार जारी किए हैं।