Pesquisadores da NVIDIA, MIT e da Universidade de Oxford apresentaram o Physis-Lang, um framework que aprimora os modelos de mundo em vídeo ao integrar linguagem física autoevolutiva nas legendas. Essa abordagem trata a linguagem física como uma representação otimizável usada para curadoria de dados, treinamento do modelo e inferência, corrigindo erros físicos nos vídeos gerados.

  • O Physis-Lang adiciona um campo `physics_reasoning` e um `physics_negative_prompt` às legendas base, detalhando entidades, causas e princípios regentes.
  • Um agente guiado por crítico evolui as instruções da legenda enquanto mantém o gerador de legendas congelado, validado no novo benchmark PhysCapBench com 246 vídeos.
  • O método utiliza curadoria de dados guiada por linguagem para recuperar clipes fisicamente relevantes, resultando em um conjunto final de treinamento de 183K vídeos.
  • O ajuste fino do Cosmos3-Nano com Physis-Lang supera o Veo 3.1 do Google no PhyGenBench (71,04 contra 65,63) e no Physics-IQ Verified (43,41 contra 34,99).
  • O pipeline pode ser destilado em modelos locais Qwen3-VL-4B-Instruct, reduzindo os custos de API de aproximadamente $24.12K para $0, mantendo ganhos significativos de física.

O framework permite que os modelos de vídeo expliquem por que e como as cenas se desenrolam, melhorando a consistência física sem exigir mudanças na arquitetura ou APIs comerciais.