يقدم الباحثون OSReward، وهو معيار واقعي مصمم لتقييم موثوقية نماذج الرؤية واللغة (VLMs) التي تعمل كحكم لمسارات وكلاء الاستخدام الحاسوبي. تكشف الدراسة أن أحدث نماذج VLM تعاني من تحيز التساهل المنهجي وغالباً ما تكون مكلفة جداً للتوسع، بينما تؤدي النماذج المفتوحة الميسورة التكلفة أداءً ضعيفاً.
- يتميز OSReward بمسارات وكلاء متنوعة مع أحكام صحيقة مستمدة من تعليق بشري متعدد المراحل عبر المنصات.
- يتضمن المعيار OSReward-Hard للحالات الصعبة وOSReward-Multi للتقييم الدقيق للكفاءة.
- أظهر التقييم أن حكام VLM الحاليين يخطئون في تصنيف الفشل على أنه نجاح، مما يخلق فجوة بين الموثوقية والتكلفة.
- لمعالجة هذه المشكلة، أصدر المؤلفون OS-Shepherd-100K، وهو مجموعة بيانات مفتوحة من أحكام المسارات المُعلَّمة بالاستدلال.
- وبفضل التدريب على هذا البيانات، تتطابق نماذج OS-Shepherd المفتوحة (9B و35B) مع حكام الشركات التجارية بتكلفة أقل بنسبة 30-60%.
يوفر العمل إشارات مكافأة منخفضة التكلفة ومستقرة للمجتمع ويقدم تحليلاً موسعاً لإرشاد تصميم تقييم موثوق للاستخدام الحاسوبي.