연구자들은 확산 모델과 흐름 매칭 모델의 추론 속도를 가속화하기 위한 단순화된 궤적 기반 방법인 병렬 디코딩 지식 증류(PDD)를 소개합니다. 현재 접근 방식이 최적화가 어려운 변분 점수 지식 증류와 적대적 손실에 의존하는 것과 달리, PDD는 단일 네트워크 평가당 여러 디노이징 단계를 예측합니다.

  • 모든 사전 학습된 모델과 호환되며 다양한 수의 함수 평가(NFE)로 샘플링을 지원합니다.
  • 야코비안-벡터 곱이나 유한 차분 근사를 사용하지 않고 평균 속도의 표현을 학습합니다.
  • 4~8 NFE에서 LTX-2.3 텍스트-비디오/오디오, Wan 14B 텍스트-비디오, Qwen-Image 텍스트-이미지 benchmarks에서 최상위 성능을 달성합니다.
  • 기존 방법과 비교하여 생성된 비디오의 다양성을 크게 향상시킵니다.

PDD는 텍스트-비디오 및 텍스트-이미지 작업 전반에 걸쳐 고품질 생성을 유지하면서 모드 붕괴를 피하는 확장 가능한 빠른 추론 대안을 제공합니다.