يقدم الباحثون تقطير القوة على السياسة (OPPD)، وهي طريقة تُدرّب نماذج اللغة على توليد إجابات عالية الجودة في تمر واحد من خلال محاكاة توزيع الاحتمالات الحادّ لنموذج المعلم. يلغي هذا النهج الحاجة إلى أخذ عينات واسعة للمرشحين أثناء الاستدلال، مع تعزيز الأداء بشكل كبير في مهام الاستدلال.
- يستخدم OPPD عيّن مونت كارلو التسلسلي حيث توزّع أوزان التوزيع القوي لمعلم متجمّد المرشحين الذين يولّدهم النموذج الذي يتم تدريبه.
- تزيد الطريقة من دقة التوليد الواحد بنسبة تصل إلى 23.0 نقطة على MATH500 و27.3 على GSM8K مقارنةً بالنموذج غير المدرب عند نفس درجة الحرارة.
- يتفوق توليد واحد من النموذج المقطّر على أخذ العينات بالقدرة المنشور مع 64 مرشحاً، مستعيداً 94 بالمائة من المكسب الذي وفرّه 16 مرشحاً في النموذج غير المدرب.
- يسجل OPPD نتائج أعلى من GRPO على MATH500 وGSM8K وAIME دون استخدام أي إجابات مرجعية، ويمكنه إضافة ما يصل إلى 9.3 نقطة عند تطبيقه بعد GRPO.
- ترفع التقنية أيضاً دقة HumanEval بنسبة تصل إلى 5.3 نقطة وتعمل عبر عائلات وأحجام نماذج مختلفة.
يوفر OPPD طريقة فعالة من حيث المعاملات لتحسين قدرات الاستدلال دون تغيير بنية النموذج أو تتطلب استدلالاً قائماً على البحث.