Tencentは、音声生成および編集のための基盤モデルAuKをオープンソースとして公開しました。Hugging FaceおよびModelScope上でコードと重みが利用可能です。今回のリリースには、わずか4ステップで高速推論を実現するよう設計された蒸留版のAuK-Flashが含まれています。

  • AuKは、数百万時間のオーディオデータで訓練された1.5Bパラメータのモデルです。
  • ゼロショットTTS、コンテンツおよび音響編集、副言語的編集、音声強化、自然言語による指示でのソース分離をサポートします。
  • リポジトリには、ベースモデルと高速版AuK-Flashの両方の公式重みが提供されています。
  • Hugging FaceおよびModelScopeプラットフォーム向けのインストールおよび使用例が提供されています。

このリリースにより、開発者はMITライセンスの下で複数の音声タスクに対する統一インターフェースにアクセスできるようになります。