AuKの技術レポートは、自然言語の指示とオーディオコンテキストを通じて音声の生成と編集を統一するオープンソースの基盤モデルを紹介します。

  • このモデルは、5つのタスクファミリーにわたる約30億3000万個の指示-オーディオインスタンスと195万時間の教師データで訓練されています。
  • アーキテクチャは、マルチモーダル大規模言語モデル、音響条件付け用のVAE、およびハイブリッド整流フローTransformerを組み合わせています。
  • 後期学習には、人間フィードバックによる好み最適化と報酬ベースの強化学習が含まれます。
  • AuK-Flashは4ステップの推論を実現し、フルモデルと比較してウォールクロック時間で4.5倍の高速化を実現します。

著者は再現性とさらなる研究をサポートするために、ソースコードとモデルの重みを公開しています。