AuC तकनीकी रिपोर्ट एक ओपन-सोर्स मौलिक मॉडल का परिचय देती है जो प्राकृतिक-भाषा निर्देशों और ऑडियो संदर्भ के माध्यम से वक्ता उत्पादन और संपादन को एकीकृत करता है।
- मॉडल को लगभग 3.03 बिलियन निर्देश-ऑडियो उदाहरणों और पांच कार्य परिवारों में 1.95 मिलियन घंटे की निगरानी पर प्रशिक्षित किया गया है।
- आर्किटेक्चर में एक बहुआयामी बड़ा भाषा मॉडल, ध्वनि शर्तबद्ध के लिए एक VAE, और एक हाइब्रिड रेक्टिफाइड-फ्लो Transformer शामिल हैं।
- पोस्ट-प्रशिक्षण में मानव-फीडबैक प्राथमिकता अनुकूलन और पुरस्कार-आधारित प्रबलन शिक्षा शामिल है।
- AuK-Flash पूरे मॉडल की तुलना में 4.5 गुना दीवार-घड़ी गति बढ़ाने के साथ 4-चरण अनुमान प्राप्त करता है।
लेखकों ने पुनरुत्पादकता और आगे के शोध का समर्थन करने के लिए स्रोत कोड और मॉडल भार जारी किए हैं।