Los investigadores presentan la Distilación de Decodificación Paralela (PDD), un método simplificado basado en trayectorias para acelerar la inferencia en modelos de difusión y emparejamiento de flujos. A diferencia de los enfoques actuales que dependen de la distilación variacional de puntuaciones difícil de optimizar y pérdidas adversarias, PDD predice múltiples pasos de desvanecimiento por evaluación de red.

  • Compatible con cualquier modelo preentrenado y admite muestreo con diferentes números de evaluaciones de función (NFE).
  • Aprende una representación de la velocidad media sin regreir su derivada utilizando productos jacobianos-vectoriales o aproximaciones de diferencias finitas.
  • Alcanza un rendimiento de vanguardia en LTX-2.3 Texto-a-Video/Audio, Wan 14B Texto-a-Video y Qwen-Imagen Texto-a-Imagen con 4-8 NFE.
  • Mejora significativamente la diversidad del video generado en comparación con los métodos existentes.

PDD ofrece una alternativa escalable para la inferencia rápida que evita el colapso de modos mientras mantiene una generación de alta calidad en tareas de texto-a-video y texto-a-imagen.