Tencent ने स्पीच जनरेशन और एडिटिंग के लिए अपने AuK 1.5B फाउंडेशन मॉडल को कोड और मॉडल वेट्स सहित ओपन-सोफ्टवेयर के रूप में उपलब्ध कराया है।
- एक समान प्राकृतिक भाषा इंटरफ़ेस के माध्यम से ज़ीरो-शॉट और निर्देश-आधारित टेक्स्ट-टू-स्पीच, सामग्री और अकाउस्टिक एडिटिंग, पैरालिंजिस्टिक एडिटिंग, स्पीच एनहान्समेंट और सोर्स सेपरेशन का समर्थन करता है।
- तेज़ इनफरेंस के लिए 4-स्टेप डिस्टिल्ड वेरिएंट AuK-Flash शामिल है।
- इसके MLLM एन्कोडर के रूप में Qwen2.5-Omni-3B मॉडल का उपयोग करता है।
- MIT लाइसेंस के तहत जारी किया गया, वेट्स Hugging Face और ModelScope पर उपलब्ध हैं।
इस रिलीज से शोधकर्ताओं और डेवलपर्स को विभिन्न ऑडियो प्रोसेसिंग कार्यों के लिए बेस मॉडल और डिस्टिल्ड वेरिएंट तक पहुंच मिलती है।