Meta की FAIR, ऑक्सफोर्ड विश्वविद्यालय और यूनिवर्सिटी कॉलेज लंदन के शोधकर्ताओं ने AI एजेंट्स को निष्पादित नहीं किए गए मशीन लर्निंग प्रयोग उम्मीदवारों को रैंक करने में मदद देने के लिए AI Research Preference Models (RPMs) पेश किए हैं। यह दृष्टिकोण उस बाधा को दूर करता है जहां विचार जनरेशन सस्ता है लेकिन GPU ट्रेनिंग के माध्यम से सत्यापन महंगा है।

  • RPMs बिना फाइन-ट्यूनिंग वाले फ्रोजन प्रीट्रेन्ड LLMs का उपयोग करते हैं, जो ओपन-सोर्स AIRA-dojo स्केफोल्ड और Qwen3.6-27B को बैकबोन के रूप में लाभान्वित करते हैं।
  • सिस्टम 15 समानांतर उम्मीदवार जनरेट करता है और वैलिडेशन स्कोर पर आधारित पेयरवाइज़ नाउआउट टूर्नामेंट के माध्यम से एक विजेता चुनता है।
  • दो वेरिएंट्स का परीक्षण किया गया: एक इन्फरेंस-ओनली जज और एक एजेंटिक जज जो सैंडबॉक्स्ड वातावरण में छोटे पायलट प्रयोग चलाता है।
  • AIRS-Bench पर, RPMs ने औसत नॉर्मलाइज्ड स्कोर को 0.684 से बढ़ाकर 0.711 (इन्फरेंस-ओनली) और 0.729 (एजेंटिक) कर दिया।
  • दोनों वेरिएंट्स ने लगभग 15 घंटे में बेलाइन का अंतिम स्कोर हासिल किया, जो यादृच्छिक चयन की तुलना में 1.5–1.6× की गति वृद्धि प्रदान करता है।

लेखकों का मानना है कि यह महत्वपूर्ण है क्योंकि इससे एजेंट्स को सबसे वादा करने वाले प्रयोगों पर कंप्यूट संसाधनों पर ध्यान केंद्रित करने की अनुमति मिलती है, जो मजबूत बेस मॉडल्स की आवश्यकता के बिना शोध प्रगति को काफी तेज करता है।