Исследователи из NVIDIA, MIT и Оксфордского университета представили Physis-Lang — фреймворк, который улучшает мировые модели видео за счёт интеграции самоэволюционирующего физического языка в подписи. Этот подход рассматривает физический язык как оптимизируемое представление, используемое для курирования данных, обучения моделей и вывода с целью исправления физических ошибок в сгенерированных видео.

  • Physis-Lang добавляет поле `physics_reasoning` и `physics_negative_prompt` к базовым подписям, детализируя сущности, причины и управляющие принципы.
  • Агент, направляемый критиком, эволюционирует инструкции подписей, оставляя генератор подписей замороженным; это проверено на новом бенчмарке PhysCapBench из 246 видео.
  • Метод использует курирование данных, направляемое языком, для извлечения физически релевантных клипов, что приводит к финальному обучающему набору из 183K видео.
  • Дообучение Cosmos3-Nano с Physis-Lang превосходит Veo 3.1 от Google на PhyGenBench (71.04 против 65.63) и Physics-IQ Verified (43.41 против 34.99).

Пайплайн можно дистиллировать в локальные модели Qwen3-VL-4B-Instruct, снижая затраты на API примерно с $24.12K до $0 при сохранении значительных улучшений физических свойств.

Фреймворк позволяет видеомоделям объяснять, почему и как разворачиваются сцены, улучшая физическую согласованность без необходимости изменений архитектуры или коммерческих API.