Исследователи из NVIDIA, MIT и Оксфордского университета представили Physis-Lang — фреймворк, который улучшает мировые модели видео за счёт интеграции самоэволюционирующего физического языка в подписи. Этот подход рассматривает физический язык как оптимизируемое представление, используемое для курирования данных, обучения моделей и вывода с целью исправления физических ошибок в сгенерированных видео.
- Physis-Lang добавляет поле `physics_reasoning` и `physics_negative_prompt` к базовым подписям, детализируя сущности, причины и управляющие принципы.
- Агент, направляемый критиком, эволюционирует инструкции подписей, оставляя генератор подписей замороженным; это проверено на новом бенчмарке PhysCapBench из 246 видео.
- Метод использует курирование данных, направляемое языком, для извлечения физически релевантных клипов, что приводит к финальному обучающему набору из 183K видео.
- Дообучение Cosmos3-Nano с Physis-Lang превосходит Veo 3.1 от Google на PhyGenBench (71.04 против 65.63) и Physics-IQ Verified (43.41 против 34.99).
Пайплайн можно дистиллировать в локальные модели Qwen3-VL-4B-Instruct, снижая затраты на API примерно с $24.12K до $0 при сохранении значительных улучшений физических свойств.
Фреймворк позволяет видеомоделям объяснять, почему и как разворачиваются сцены, улучшая физическую согласованность без необходимости изменений архитектуры или коммерческих API.