NVIDIA, MIT और ऑक्सफोर्ड विश्वविद्यालय के शोधकर्ताओं ने Physis-Lang पेश किया है, एक फ्रेमवर्क जो कैप्शन में स्व-विकासशील भौतिक भाषा को एकीकृत करके वीडियो वर्ल्ड मॉडल को बढ़ावा देता है। यह दृष्टिकोण भौतिक भाषा को डेटा चयन, मॉडल प्रशिक्षण और उत्पन्न वीडियों में भौतिक त्रुटियों को ठीक करने के लिए उपयोग की जाने वाली एक अनुकूलनीय निरूपण के रूप में मानता है।

  • Physis-Lang आधार कैप्शन में `physics_reasoning` फ़ील्ड और `physics_negative_prompt` जोड़ता है, जिसमें इकाइयों, कारणों और शासक सिद्धांतों का विवरण दिया गया है।
  • एक आलोचक-निर्देशित एजेंट कैप्शनर को स्थिर रखते हुए कैप्शन निर्देशों को विकसित करता है, जिसकी पुष्टि 246 वीडियो के नए PhysCapBench बेंचमार्क पर की गई है।
  • इस विधि में भाषा-निर्देशित डेटा चयन का उपयोग भौतिक रूप से प्रासंगिक क्लिप को पुनः प्राप्त करने के लिए किया जाता है, जिससे अंतिम प्रशिक्षण सेट 183K वीडियो का बनता है।
  • Physis-Lang के साथ Cosmos3-Nano का फाइन-ट्यूनिंग PhyGenBench (71.04 बनाम 65.63) और Physics-IQ Verified (43.41 बनाम 34.99) पर Google के Veo 3.1 को हराता है।
  • पाइपलाइन को स्थानीय Qwen3-VL-4B-Instruct मॉडल में संक्षिप्त किया जा सकता है, जिससे API लागत लगभग $24.12K से घटकर $0 हो जाती है, जबकि महत्वपूर्ण भौतिक लाभ बनाए रखे जाते हैं।

यह फ्रेमवर्क वीडियो मॉडल को यह समझाने की अनुमति देता है कि दृश्य क्यों और कैसे विकसित होते हैं, जिससे भौतिक स्थिरता में सुधार होता है बिना किसी वास्तुकला परिवर्तन या व्यावसायिक API की आवश्यकता के।