来自NVIDIA、麻省理工学院和牛津大学的研究人员推出了Physis-Lang,这是一个通过将自我演化的物理语言整合到字幕中来增强视频世界模型的框架。该方法将物理语言视为一种可优化的表示形式,用于数据筛选、模型训练和推理,以纠正生成视频中的物理错误。

  • Physis-Lang在基础字幕中添加了`physics_reasoning`字段和`physics_negative_prompt`,详细描述了实体、原因及支配原则。
  • 批评家引导的智能体在保持字幕生成器冻结的情况下演化字幕指令,并在包含246个视频的新PhysCapBench基准上进行了验证。
  • 该方法使用语言引导的数据筛选来检索具有物理相关性的片段,最终形成183K个视频的训练集。
  • 使用Physis-Lang微调Cosmos3-Nano在PhyGenBench(71.04对比65.63)和Physics-IQ Verified(43.41对比34.99)上均优于Google的Veo 3.1。
  • 该流程可蒸馏至本地Qwen3-VL-4B-Instruct模型,将API成本从约24,120美元降至0美元,同时保持显著的物理性能提升。

该框架使视频模型能够解释场景为何以及如何展开,从而在不需要架构更改或商业API的情况下提高物理一致性。