ByteDance Seed और Tsinghua AIR ने CUDA Agent पेश किया है, एक एजेंटिक रिइन्फोर्समेंट लर्निंग सिस्टम जो Seed1.6 बड़े भाषा मॉडल को कंपाइलरों से बेहतर प्रदर्शन करने वाले GPU कर्नेल लिखने के लिए प्रशिक्षित करता है।
- सिस्टम प्रोफाइलिंग सैंडबॉक्स और सहीता जांच के भीतर 131,072-टोकन संदर्भ के साथ 150 चरणों पर PPO प्रशिक्षण का उपयोग करता है।
- यह KernelBench बेंचमार्क पर 98.8% पास दर और torch.compile से 96.8% तेज दर हासिल करता है, जिससे 2.11× ज्यामितीय-माध्य गति वृद्धि मिलती है।
- शोध टीम ने CUDA-Agent-Ops-6K डेटासेट, SKILL.md स्पेक और रिवार्ड रेसिपी जारी की, लेकिन प्रशिक्षित एजेंट वजन नहीं।
- अलबेशन दिखाते हैं कि एजेंट लूप को हटाने से कंपाइलर से तेज दर 96.8% से घटकर 14.1% हो जाती है, जो एजेंटिक दृष्टिकोण के महत्व को उजागर करता है।
यह कार्य दिखाता है कि पुनरावृत्ति प्रोफाइलिंग के साथ एक वास्तविक CUDA विकास वातावरण में LLM को रखने से जनरेट किए गए और हैंड-राइट या कंपाइलर-जनरेटेड कर्नेल्स के बीच प्रदर्शन अंतर को काफी कम किया जा सकता है।