NVIDIA、MIT、オックスフォード大学の研究者らは、自己進化型の物理言語をキャプションに統合することで動画の世界モデルを強化するフレームワーク「Physis-Lang」を発表した。この手法は、生成された動画の物理エラーを修正するために、データ選別、モデル学習、推論に使用される最適化可能な表現として物理言語を取り扱う。
- Physis-Langは基本キャプションに`physics_reasoning`フィールドと`physics_negative_prompt`を追加し、エンティティ、原因、支配原理を詳細に記述する。
- 批評家主導のエージェントがキャプション作成者を固定したままキャプション指示を進化させ、246本の動画からなる新しいPhysCapBenchベンチマークで検証された。
- この手法は言語誘導のデータ選別を用いて物理的に関連性の高いクリップを取得し、最終的な学習セットとして183K本の動画を作成した。
- Physis-LangでCosmos3-Nanoをファインチューニングすると、PhyGenBench(71.04 vs 65.63)およびPhysics-IQ Verified(43.41 vs 34.99)においてGoogleのVeo 3.1を上回る。
- このパイプラインはローカルのQwen3-VL-4B-Instructモデルに蒸留可能であり、大幅な物理性能の向上を維持しつつ、APIコストを約$24.12Kから$0に削減する。
このフレームワークにより、動画モデルはシーンがなぜ、どのように展開するかを説明できるようになり、アーキテクチャの変更や商用APIの必要なく物理的一貫性を改善できる。