أفاد فريق بحثي من FAIR في ميتا، وجامعة أكسفورد، وكلية لندن الجامعية بتقديم نماذج تفضيل البحث (RPMs) لمساعدة وكلاء الذكاء الاصطناعي على ترتيب المرشحين لتجارب التعلم الآلي غير المنفذة. يتصدّى هذا النهج للرقبة الزجاجة حيث يكون توليد الأفكار رخيصاً، لكن التحقق منه عبر تدريب وحدات معالجة الرسومات مكلف.
- تستخدم نماذج RPMs نماذج لغوية كبيرة مدربة مسبقاً مجمّدة دون ضبط دقيق، مستفيدة من إطار عمل AIRA-dojo مفتوح المصدر وQwen3.6-27B كبنية أساسية.
- يولّد النظام 15 مرشحاً متوازياً ويختار فائزاً واحداً عبر بطولة خروج مباشر ثنائية تستند إلى درجات التحقق من الصحة.
- تم اختبار متغيرين: حكم يعتمد على الاستدلال فقط، وحكم وكيليّ يشغّل تجارب استطلاعية قصيرة في بيئة معزولة.
- على AIRS-Bench، حسّنت نماذج RPMs متوسط الدرجات المعيَّرة من 0.684 إلى 0.711 (لحكم الاستدلال فقط) و0.729 (للحكم الوكيلي).
- حقّق المتغيران درجة الأساس النهائية في حوالي 15 ساعة، مما يوفر تسريعاً بنسبة 1.5–1.6× مقارنة بالاختيار العشوائي.
يُعتبر المؤلفون هذا الأمر مهماً لأنه يسمح للوكلاء بتركيز موارد الحوسبة على التجارب الأكثر واعدة، مما يُسرّع بشكل كبير تقدم البحث دون الحاجة إلى نماذج أساسية أقوى.