AuKの技術レポートは、自然言語の指示とオーディオコンテキストを通じて音声の生成と編集を統一するオープンソースの基盤モデルを紹介します。
- このモデルは、5つのタスクファミリーにわたる約30億3000万個の指示-オーディオインスタンスと195万時間の教師データで訓練されています。
- アーキテクチャは、マルチモーダル大規模言語モデル、音響条件付け用のVAE、およびハイブリッド整流フローTransformerを組み合わせています。
- 後期学習には、人間フィードバックによる好み最適化と報酬ベースの強化学習が含まれます。
- AuK-Flashは4ステップの推論を実現し、フルモデルと比較してウォールクロック時間で4.5倍の高速化を実現します。
著者は再現性とさらなる研究をサポートするために、ソースコードとモデルの重みを公開しています。