शोधकर्ताओं ने OSReward का परिचय दिया, एक यथार्थवादी बेंचमार्क जो कंप्यूटर-यूज़िंग एजेंट ट्रेजेक्टरीज़ के लिए जज के रूप में कार्य करने वाले विज़न-लैंग्वेज मॉडल्स (VLMs) की विश्वसनीयता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। अध्ययन से पता चलता है कि भले ही राज्य-दर-श्रेणी VLMs व्यवस्थित कोमलता पूर्वाग्रह से ग्रस्त हैं और स्केल के लिए अक्सर बहुत महंगे हैं, जबकि सस्ते ओपन मॉडल खराब प्रदर्शन करते हैं।
- OSReward में प्लेटफ़ॉर्म भर में बहु-चरण मानव एनोटेशन से प्राप्त ग्राउंड-ट्रूथ वरिक्ट्स के साथ विविध एजेंट ट्रेजेक्टरीज़ शामिल हैं।
- बेंचमार्क में चुनौतीपूर्ण मामलों के लिए OSReward-Hard और सूक्ष्म-स्तर दक्षता स्कोरिंग के लिए OSReward-Multi शामिल है।
- मूल्यांकन दिखाता है कि वर्तमान VLM जज विफल रनों को सफलता के रूप में गलत लेबल करते हैं, जिससे विश्वसनीयता और लागत के बीच अंतर पैदा होता है।
- इस समस्या को दूर करने के लिए, लेखकों ने OS-Shepherd-100K जारी किया है, जो तर्क-एनोटेटेड ट्रेजेक्टरी जजमेंट्स का एक ओपन कॉरपस है।
- इस डेटा पर प्रशिक्षित ओपन OS-Shepherd मॉडल्स (9B और 35B) वाणिज्यिक जजों के बराबर हैं, लेकिन लागत 30-60% कम है।
यह कार्य समुदाय के लिए कम लागत वाले, स्थिर रिवर्ड सिग्नल प्रदान करता है और विश्वसनीय कंप्यूटर-यूज़ मूल्यांकन के डिज़ाइन को सूचित करने के लिए विस्तृत विश्लेषण पेश करता है।