Tencentは、音声生成および編集のための基盤モデルAuK 1.5Bを、コードおよびモデルウェイトとともにオープンソースソフトウェアとして公開しました。
- 統一された自然言語インターフェースを通じて、ゼロショットおよび指示ベースのテキストから音声への変換、コンテンツおよび音響編集、パラリンギスティック編集、音声強化、およびソース分離をサポートします。
- より高速な推論のための4ステップ蒸留版であるAuK-Flashを含みます。
- MLLMエンコーダーとしてQwen2.5-Omni-3Bモデルを利用しています。
- MITライセンスの下でリリースされ、ウェイトはHugging FaceおよびModelScopeで利用可能です。
このリリースにより、研究者や開発者は、さまざまな音声処理タスクのためにベースモデルおよび蒸留版にアクセスできるようになります。