Des chercheurs de NVIDIA, du MIT et de l'Université d'Oxford ont présenté Physis-Lang, un cadre qui améliore les modèles mondiaux vidéo en intégrant un langage physique auto-évolutif dans les légendes. Cette approche traite le langage physique comme une représentation optimisable utilisée pour la curation des données, l'entraînement du modèle et l'inférence afin de corriger les erreurs physiques dans les vidéos générées.

  • Physis-Lang ajoute un champ `physics_reasoning` et un `physics_negative_prompt` aux légendes de base, détaillant les entités, les causes et les principes régissant.
  • Un agent guidé par un critique fait évoluer les instructions de la légende tout en gardant le générateur de légendes figé, validé sur le nouveau benchmark PhysCapBench composé de 246 vidéos.
  • La méthode utilise une curation des données guidée par le langage pour récupérer des clips physiquement pertinents, aboutissant à un ensemble d'entraînement final de 183K vidéos.
  • Le fine-tuning de Cosmos3-Nano avec Physis-Lang bat Veo 3.1 de Google sur PhyGenBench (71,04 contre 65,63) et Physics-IQ Verified (43,41 contre 34,99).
  • Le pipeline peut être distillé dans des modèles locaux Qwen3-VL-4B-Instruct, réduisant les coûts d'API d'environ 24 120 $ à 0 $ tout en maintenant des gains physiques significatifs.

Le cadre permet aux modèles vidéo d'expliquer pourquoi et comment les scènes se déroulent, améliorant la cohérence physique sans nécessiter de modifications architecturales ni d'API commerciales.