研究者たちは、タスクを時間条件付き潜在ドメイン変換として再構成することで、長時間のビデオリライティングにおける時間的不連続性に対処します。このフレームワークは、ターゲットドメインの潜在変数を境界間で伝播させることでチャンク間の連続性を強制し、マスクされたターゲットドメイン自己条件付けを使用して、この挙動を学習可能にします。

  • チャンク境界間でターゲットドメインの潜在変数を伝播させ、時間的一貫性を維持します。
  • マスクされたターゲットドメイン自己条件付けを採用し、時間的にマスクされた伝播コンテキストから継続するようにモデルを訓練します。
  • 初期ターゲットドメイン状態を確立するために、リライティングプロンプトアンカー付きのウォームスタートプロンプティングを導入します。
  • 制御可能な生成モデルを使用して、プロンプトベースのリライティングのための一般的なインターフェースを提供します。

野外の長時間ビデオでの実験により、時間的一貫性が大幅に改善され、チャンク境界のアーティファクトが大幅に減少し、チャンク間の望ましくない外観変化が大きく抑制されました。