Peneliti dari NVIDIA, MIT, dan Universitas Oxford telah memperkenalkan Physis-Lang, sebuah kerangka kerja yang meningkatkan model dunia video dengan mengintegrasikan bahasa fisik yang berevolusi secara mandiri ke dalam caption. Pendekatan ini memperlakukan bahasa fisik sebagai representasi yang dapat dioptimalkan untuk kurasi data, pelatihan model, dan inferensi guna memperbaiki kesalahan fisika pada video yang dihasilkan.

  • Physis-Lang menambahkan bidang `physics_reasoning` dan `physics_negative_prompt` ke caption dasar, yang mendetailkan entitas, penyebab, dan prinsip-prinsip pengatur.
  • Agen yang dipandu oleh kritikus mengembangkan instruksi caption sambil menjaga captioner tetap beku, divalidasi pada benchmark PhysCapBench baru yang terdiri dari 246 video.
  • Metode ini menggunakan kurasi data berbasis bahasa untuk mengambil klip yang relevan secara fisik, menghasilkan kumpulan pelatihan akhir sebanyak 183K video.
  • Fine-tuning Cosmos3-Nano dengan Physis-Lang mengalahkan Veo 3.1 milik Google pada PhyGenBench (71,04 vs 65,63) dan Physics-IQ Verified (43,41 vs 34,99).
  • Pipa ini dapat didistilasi ke dalam model Qwen3-VL-4B-Instruct lokal, mengurangi biaya API dari sekitar $24.12K menjadi $0 sambil mempertahankan peningkatan fisika yang signifikan.

Kerangka kerja ini memungkinkan model video menjelaskan mengapa dan bagaimana adegan berlangsung, meningkatkan konsistensi fisik tanpa memerlukan perubahan arsitektur atau komersial API.