Tencentは、音声生成および編集のための基盤モデルAuK 1.5Bを、コードおよびモデルウェイトとともにオープンソースソフトウェアとして公開しました。

  • 統一された自然言語インターフェースを通じて、ゼロショットおよび指示ベースのテキストから音声への変換、コンテンツおよび音響編集、パラリンギスティック編集、音声強化、およびソース分離をサポートします。
  • より高速な推論のための4ステップ蒸留版であるAuK-Flashを含みます。
  • MLLMエンコーダーとしてQwen2.5-Omni-3Bモデルを利用しています。
  • MITライセンスの下でリリースされ、ウェイトはHugging FaceおよびModelScopeで利用可能です。

このリリースにより、研究者や開発者は、さまざまな音声処理タスクのためにベースモデルおよび蒸留版にアクセスできるようになります。