Los investigadores abordan las discontinuidades temporales en el relighting de video a largo plazo reformulando la tarea como una traducción de dominio latente condicionada temporalmente. El marco impone continuidad entre fragmentos propagando los latentes del dominio objetivo a través de los límites y utiliza autocondicionamiento enmascarado del dominio objetivo para hacer que este comportamiento sea aprendible.

  • Propaga los latentes del dominio objetivo a través de los límites de los fragmentos para mantener la consistencia temporal.
  • Emplea autocondicionamiento enmascarado del dominio objetivo, entrenando al modelo para continuar desde un contexto propagado con enmascaramiento temporal.
  • Introduce el inicio en caliente con un ancla de prompt de relighting para establecer el estado inicial del dominio objetivo.
  • Proporciona una interfaz general para el relighting basado en prompts utilizando un modelo generativo controlable.

Los experimentos en videos de larga duración del mundo real muestran una consistencia temporal notablemente mejorada, con artefactos en los límites de los fragmentos reducidos en gran medida y cambios no deseados en la apariencia entre fragmentos suprimidos en gran medida.