Исследователи решают проблему временных разрывов при переосвещении длинных видеороликов, переформулируя задачу как перевод латентной области с временным условием. Фреймворк обеспечивает непрерывность между фрагментами путем распространения латентов целевой области через границы и использует маскированное самовоздействие в целевой области, чтобы сделать это поведение обучаемым.

  • Распространяет латенты целевой области через границы фрагментов для поддержания временной согласованности.
  • Использует маскированное самовоздействие в целевой области, обучая модель продолжать работу с контекстом, где часть временных данных замаскирована.
  • Вводит инициализацию с помощью промпта с якорем переосвещения для установления начального состояния целевой области.
  • Предоставляет общий интерфейс для переосвещения на основе промптов с использованием управляемой генеративной модели.

Эксперименты на видеороликах из реальной жизни показывают значительно улучшенную временную согласованность, при этом артефакты на границах фрагментов в значительной степени устранены, а нежелательные изменения внешнего вида между фрагментами сильно подавлены.