NVIDIA, MIT, 옥스퍼드 대학교 연구진은 captions에 자기 진화적 물리 언어를 통합하여 비디오 월드 모델을 강화하는 프레임워크인 Physis-Lang을 소개했습니다. 이 접근 방식은 물리 언어를 생성된 비디오의 물리 오류를 수정하기 위해 데이터 선별, 모델 학습 및 추론에 사용되는 최적화 가능한 표현으로 간주합니다.
- Physis-Lang은 기본 captions에 `physics_reasoning` 필드와 `physics_negative_prompt`를 추가하여 엔티티, 원인 및 지배 원리를 상세히 설명합니다.
- 비평가 기반 에이전트가 captioner는 고정된 상태로 유지하면서 caption 지침을 진화시키며, 이는 246개의 비디오로 구성된 새로운 PhysCapBench 벤치마크에서 검증되었습니다.
- 이 방법은 언어 기반 데이터 선별을 사용하여 물리적으로 관련성 있는 클립을 검색하며, 최종 학습 세트는 183K개의 비디오로 구성됩니다.
- Physis-Lang으로 Cosmos3-Nano를 파인튜닝하면 Google의 Veo 3.1보다 PhyGenBench(71.04 대 65.63)와 Physics-IQ Verified(43.41 대 34.99)에서 더 나은 성능을 보입니다.
- 이 파이프라인은 로컬 Qwen3-VL-4B-Instruct 모델로 증류할 수 있으며, 상당한 물리 성능 향상을 유지하면서 API 비용을 약 $24.12K에서 $0로 줄입니다.
이 프레임워크는 비디오 모델이 장면이 어떻게 전개되는지 그 이유와 방법을 설명할 수 있게 하여, 아키텍처 변경이나 상용 API 필요성 없이 물리적 일관성을 개선합니다.