Les chercheurs abordent les discontinuités temporelles dans le relighting vidéo de longue durée en reformulant la tâche comme une traduction de domaine latent conditionnée temporellement. Le cadre impose une continuité inter-blocs en propageant les latents du domaine cible à travers les frontières et utilise l'auto-conditionnement masqué du domaine cible pour rendre ce comportement apprenable.
- Propage les latents du domaine cible à travers les frontières des blocs pour maintenir la cohérence temporelle.
- Emploie l'auto-conditionnement masqué du domaine cible, entraînant le modèle à continuer à partir d'un contexte propagé avec masquage temporel.
- Introduit l'amorçage par prompt avec une ancre de prompt de relighting pour établir l'état initial du domaine cible.
- Fournit une interface générale pour le relighting basé sur des prompts en utilisant un modèle génératif contrôlable.
Les expériences sur des vidéos de longue durée réelles montrent une cohérence temporelle nettement améliorée, avec des artefacts aux frontières des blocs largement réduits et des changements d'apparence indésirables entre les blocs fortement supprimés.