قدّم باحثون من إنفيديا ومعهد ماساتشوستس للتكنولوجيا وجامعة أكسفورد إطار عمل Physis-Lang، الذي يعزز نماذج العالم المرئي من خلال دمج لغة فيزيائية تتطور ذاتياً في التسميات. يعامل هذا النهج اللغة الفيزيائية على أنها تمثيل قابل للتحسين يُستخدم لتنقية البيانات، وتدريب النموذج، والاستدلال لتصحيح الأخطاء الفيزيائية في الفيديوهات المُولَّدة.

  • يضيف Physis-Lang حقل `physics_reasoning` و `physics_negative_prompt` إلى التسميات الأساسية، مما يفصّل الكيانات والأسباب والمبادئ الحاكمة.
  • يتطور وكيل مُوجَّه بالنقد تعليمات التسمية مع إبقاء مولّد التسميات ثابتاً، وقد تم التحقق من صحته على المعيار الجديد PhysCapBench المكوّن من 246 فيديو.
  • تستخدم الطريقة تنقية البيانات الموجهة باللغة لاسترجاع مقاطع ذات صلة فيزيائياً، مما يؤدي إلى مجموعة تدريب نهائية تضم 183 ألف فيديو.
  • أدّى ضبط Cosmos3-Nano الدقيق باستخدام Physis-Lang إلى تفوقه على Veo 3.1 من جوجل على PhyGenBench (71.04 مقابل 65.63) و Physics-IQ Verified (43.41 مقابل 34.99).
  • يمكن ضغط خط الأنابيب إلى نماذج Qwen3-VL-4B-Instruct المحلية، مما يقلل تكاليف واجهة برمجة التطبيقات من حوالي 24,120 دولاراً إلى صفر مع الحفاظ على مكاسب فيزيائية كبيرة.

يتيح الإطار لنماذج الفيديو شرح سبب وكيفية تطور المشاهد، مما يحسّن الاتساق الفيزيائي دون الحاجة إلى تغييرات في البنية أو واجهات برمجة التطبيقات التجارية.