يقدم الباحثون تقطيع قوة السياسة الذاتية (OPPD)، وهي طريقة تدرب النماذج على توليد إجابات عالية الجودة في تمر واحد من خلال محاكاة توزيع الاحتمالات الحاد لنموذج المعلم. يلغي هذا النهج الحاجة إلى أخذ عينات مرشحة واسعة أثناء الاستدلال مع تعزيز الأداء بشكل كبير في الاختبارات الرياضية وبرمجيات البرمجة.

  • يستخدم OPPD عيّن مونت كارلو التسلسلي حيث توزع أوزان توزيع القوة لمعلم متجمد المرشحين الذين يولدهم نموذج الطالب لتحديثات الاحتمال الأقصى.
  • تزيد الطريقة من دقة التوليد الواحد بنقطة تصل إلى 23.0 على MATH500 و27.3 نقطة على GSM8K مقارنة بالخط الأساسي غير المدرب عند نفس درجة الحرارة.
  • يتفوق التوليد الواحد من النموذج المُقطّع على أخذ العينات بقوة مع 64 مرشحاً، مستعيداً 94 بالمائة من المكسب الذي وفرته 16 مرشحاً في النموذج غير المدرب.
  • يسجل OPPD نتائج أعلى من GRPO المدرب بمكافآت موثقة على MATH500 وGSM8K وAIME دون استخدام إجابات مرجعية، ويمكنه إضافة ما يصل إلى 9.3 نقطة عند تطبيقه بعد GRPO.
  • ترفع التقنية دقة HumanEval بنقطة تصل إلى 5.3 وتحافظ على المكاسب عبر عائلات وأحجام نماذج مختلفة.

تتيح هذه الطريقة للنماذج تحقيق تحسينات في الاستدلال تتطلب عادةً أخذ عينات مكثف أو بيانات مرجعية إضافية من خلال تحديثات المعاملات المباشرة.