Os pesquisadores abordam descontinuidades temporais no relighting de vídeos de longo prazo reformulando a tarefa como tradução de domínio latente condicionado temporalmente. A estrutura impõe continuidade entre blocos propagando os latentes do domínio-alvo através dos limites e utiliza autocondicionamento mascarado do domínio-alvo para tornar esse comportamento aprendível.

  • Propaga os latentes do domínio-alvo através dos limites dos blocos para manter a consistência temporal.
  • Emprega autocondicionamento mascarado do domínio-alvo, treinando o modelo para continuar a partir de um contexto propagado com mascaramento temporal.
  • Introduz inicialização com prompt usando uma âncora de prompt de relighting para estabelecer o estado inicial do domínio-alvo.
  • Fornece uma interface geral para relighting baseado em prompts usando um modelo generativo controlável.

Experimentos em vídeos de longo prazo do mundo real mostram consistência temporal significativamente melhorada, com artefatos nos limites dos blocos amplamente reduzidos e mudanças indesejadas de aparência entre blocos fortemente suprimidas.