Les chercheurs introduisent la distillation de décodage parallèle (PDD), une méthode simplifiée basée sur des trajectoires pour accélérer l'inférence dans les modèles de diffusion et d'appariement de flux. Contrairement aux approches actuelles qui reposent sur une distillation de score variationnel difficile à optimiser et des pertes adversariales, PDD prédit plusieurs étapes de débruitage par évaluation du réseau.
- Compatible avec n'importe quel modèle pré-entraîné et prend en charge l'échantillonnage avec un nombre variable d'évaluations de fonction (NFE).
- Apprend une représentation de la vitesse moyenne sans régresser sa dérivée à l'aide de produits jacobien-vecteur ou d'approximations aux différences finies.
- Atteint des performances de pointe sur LTX-2.3 Text-to-Video/Audio, Wan 14B Text-to-Video et Qwen-Image Text-to-Image avec 4 à 8 NFE.
- Améliore considérablement la diversité des vidéos générées par rapport aux méthodes existantes.
PDD offre une alternative évolutive pour une inférence rapide qui évite l'effondrement du mode tout en maintenant une génération de haute qualité sur les tâches de texte vers vidéo et de texte vers image.