يقدم الباحثون PLVR (تعلم البرامج بمكافآت قابلة للتحقق)، وهي طريقة ما بعد التدريب تتعلم برامج استدلالية صريحة مكونة من بدائل حتمية وعصبية بدلاً من تحديث أوزان النموذج. يستخدم النهج الانتشار العكسي الرمزي، حيث يتم تعيين الائتمان عبر استنتاج النوع على توقيعات البدائل بدلاً من التقدير.
- على LiveCodeBench v6 وTau2Bench، تتفوق النماذج الأساسية بحجم 30B مع PLVR على التعلم بالتعزيز بمعدل 27.8 نقطة في المتوسط عند ميزانية مماثلة.
- تتفوق الطريقة أيضًا على النماذج المتقدمة الأكبر حجمًا بترتيب مقداري واحد بنسبة 13.6 نقطة.
- مكتبة بدائل واحدة تخدم كلا المعيارين، وتحتاج فقط إلى 100 مثال للمهام الجديدة دون بيانات ضبط دقيق إضافية.
- تحدد التجارب أن المرور العكسي هو مصدر الميزة مقارنة بالعينة المنتظمة.
يطلق المؤلفون مكتبة للانتشار العكسي الرمزي وفاحص مطابقة للسماح بالتطبيق على مكتبات بدائل أخرى.