Исследователи решают проблему временных разрывов при переосвещении длинных видеороликов, переформулируя задачу как перевод латентной области с временным условием. Фреймворк обеспечивает непрерывность между фрагментами путем распространения латентов целевой области через границы и использует маскированное самовоздействие в целевой области, чтобы сделать это поведение обучаемым.
- Распространяет латенты целевой области через границы фрагментов для поддержания временной согласованности.
- Использует маскированное самовоздействие в целевой области, обучая модель продолжать работу с контекстом, где часть временных данных замаскирована.
- Вводит инициализацию с помощью промпта с якорем переосвещения для установления начального состояния целевой области.
- Предоставляет общий интерфейс для переосвещения на основе промптов с использованием управляемой генеративной модели.
Эксперименты на видеороликах из реальной жизни показывают значительно улучшенную временную согласованность, при этом артефакты на границах фрагментов в значительной степени устранены, а нежелательные изменения внешнего вида между фрагментами сильно подавлены.