VHD-Play एक पाइपलाइन है जो गणितीय मॉडलों को सैंपल और हल करने के बाद उनके निर्णय प्रक्रियाओं को स्टेटफुल टूल्स के रूप में रेंडर करके विविध एजेंटिक रिइन्फोर्समेंट लर्निंग पर्यावरण उत्पन्न करता है। यह दृष्टिकोण सुनिश्चित करता है कि निष्पादन योग्य गतिशीलता और ट्राजेक्टरी-स्कोरिंग संदर्भ सीधे हल किए गए मॉडल से विरासत में मिलें, जो मौजूदा जनरेशन पाइपलाइनों में सामान्य असंगति समस्याओं को दूर करता है।

  • पाइपलाइन प्रत्येक के कुछ पैसे की लागत पर 3,300 विविध एजेंटिक पर्यावरण उत्पन्न करती है।
  • पांच-परिवार डायग्नोस्टिक में Qwen3.6-35B-A3B को तीन परिवारों पर प्रशिक्षित करने से इसका माध्य एजेंटिक स्कोर 0.204 से बढ़कर 0.815 हो जाता है।
  • लाभ हल्ड-आउट उदाहरणों, आठ अदृश्य तंत्र परिवारों और सामान्य फ़ंक्शन कॉलिंग, यात्रा योजना और ई-कॉमर्स के लिए बाहरी बेंचमार्कों तक फैले हुए हैं।
  • लिखित समस्याओं और स्टेटफुल संस्करणों के बीच की तुलना दिखाती है कि सीखने योग्य अंतर मुख्य रूप से तंत्र के हल करने में नहीं, बल्कि स्टेटफुल इंटरैक्शन में निहित है।

लेखक इसे महत्वपूर्ण मानते हैं क्योंकि एक फ्रोजन 35B सेटर बड़े पर्यावरणों को साकार कर सकता है, और तंत्र के आकार और हॉरिज़न बढ़ने पर स्केल-मैच्ड प्रशिक्षण लाभ को बनाए रखता है, जो विकासशील प्रशिक्षण सबस्ट्रेट की संभावना को दर्शाता है।