研究人员引入了并行解码蒸馏(PDD),这是一种简化的基于轨迹的方法,用于加速扩散模型和流匹配模型的推理。与当前依赖难以优化的变分分数蒸馏和对抗性损失的方法不同,PDD 在每次网络评估中预测多个去噪步骤。
- 兼容任何预训练模型,并支持使用不同数量的函数评估(NFE)进行采样。
- 学习平均速度的表示,而无需使用雅可比向量积或有限差分近似来回归其导数。
- 在 LTX-2.3 文本到视频/音频、Wan 14B 文本到视频以及 Qwen-Image 文本到图像任务上,以 4-8 NFE 实现了最先进的性能。
- 与现有方法相比,显著提高了生成视频的多样性。
PDD 提供了一种可扩展的快速推理替代方案,在避免模式崩溃的同时,保持文本到视频和文本到图像任务的高质量生成。