研究者らが、拡散モデルやフローマッチングモデルの推論を加速するための簡素化された軌道ベース手法であるParallel Decoding Distillation (PDD)を紹介する。現在の手法が最適化が困難な変分スコア蒸留や敵対的損失に依存しているのに対し、PDDは1回のネットワーク評価で複数のノイズ除去ステップを予測する。
- 任意の事前学習済みモデルと互換性があり、関数評価数(NFE)を変えてサンプリングをサポートする。
- ヤコビアン・ベクトル積や有限差分近似を用いてその微分を回帰することなく、平均速度の表現を学習する。
- 4〜8 NFEでLTX-2.3 Text-to-Video/Audio、Wan 14B Text-to-Video、Qwen-Image Text-to-Imageにおいて最先端のパフォーマンスを実現する。
- 既存手法と比較して生成された動画の多様性を大幅に向上させる。
PDDは、テキストから動画や画像への生成タスク全体で高品質な生成を維持しつつモード崩壊を回避し、高速推論のためのスケーラブルな代替手段を提供する。