शोधकर्ताओं ने PLVR (Program Learning with Verifiable Rewards) पेश किया, जो एक पोस्ट-ट्रेनिंग विधि है जो मॉडल वजन को अपडेट करने के बजाय निश्चित और तंत्रिका प्राइमिटिव्स से बने स्पष्ट तर्क कार्यक्रमों को सीखती है। यह दृष्टिकोण प्रतीकात्मक बैकप्रोपगेशन का उपयोग करता है, जहाँ क्रेडिट असाइनमेंट प्राइमिटिव सिग्नेचर पर प्रकार निष्कर्ष के माध्यम से किया जाता है, अनुमानित करने के बजाय।

  • LiveCodeBench v6 और Tau2Bench पर, PLVR के साथ 30B बेस मॉडल समान बजट पर औसतन 27.8 अंक से रीइन्फोर्समेंट लर्निंग को हराते हैं।
  • यह विधि आकार में दस गुना बड़े फ्रंटियर मॉडल्स को भी 13.6 अंक से बेहतर करती है।
  • एकल प्राइमिटिव लाइब्रेरी दोनों बेंचमार्क्स के लिए काम करती है, नई कार्यों के लिए अतिरिक्त फाइन-ट्यूनिंग डेटा के बिना केवल 100 उदाहरणों की आवश्यकता होती है।
  • प्रयोगों ने समान वितरण से नमूनाकरण पर लाभ का स्रोत के रूप में बैकवर्ड पास को पहचाना।

लेखकों ने अन्य प्राइमिटिव लाइब्रेरीज पर अनुप्रयोग की अनुमति देने के लिए एक प्रतीकात्मक बैकप्रोपगेशन लाइब्रेरी और कन्फॉर्मेंस चेकर जारी किया है।