Investigadores de NVIDIA, MIT y la Universidad de Oxford han presentado Physis-Lang, un marco que mejora los modelos de mundo en vídeo integrando lenguaje físico autoevolutivo en las descripciones. Este enfoque trata el lenguaje físico como una representación optimizable utilizada para la curación de datos, el entrenamiento del modelo y la inferencia para corregir errores físicos en los vídeos generados.
- Physis-Lang añade un campo `physics_reasoning` y un `physics_negative_prompt` a las descripciones base, detallando entidades, causas y principios rectores.
- Un agente guiado por crítico evoluciona las instrucciones de la descripción mientras mantiene congelado al generador de descripciones, validado en el nuevo benchmark PhysCapBench con 246 vídeos.
- El método utiliza curación de datos guiada por lenguaje para recuperar clips físicamente relevantes, resultando en un conjunto final de entrenamiento de 183K vídeos.
- El ajuste fino de Cosmos3-Nano con Physis-Lang supera a Veo 3.1 de Google en PhyGenBench (71.04 frente a 65.63) y Physics-IQ Verified (43.41 frente a 34.99).
- La tubería puede destilarse en modelos locales Qwen3-VL-4B-Instruct, reduciendo los costes de API de aproximadamente $24.12K a $0 mientras se mantienen ganancias significativas en física.
El marco permite a los modelos de vídeo explicar por qué y cómo se desarrollan las escenas, mejorando la consistencia física sin requerir cambios arquitectónicos ni APIs comerciales.