يقترح الباحثون التنقيح الذاتي غير الخاضع للإشراف في السياسة الحالية (U-OPSD)، وهي طريقة تحقق تحسينًا ما بعد التدريب لنماذج اللغات الكبيرة باستخدام توليدات النموذج الخاصة به فقط دون إشراف خارجي. تعتمد الطريقة على أخذ عينات من عدة مسارات لبناء حل شبه صحيح عبر التصويت بالأغلبية، ثم تنقيح توزيع المعلم إلى بادئات أطول إكمال خاطئ للنموذج.
- يحسّن U-OPSD النماذج الأساسية بنسبة 8.5% و10.7% في وضع Qwen3 غير المتفكر عند مقاييس 4B و8B عبر معايير مثل AIME24 وMATH500 وAMC23.
- يتفوق على الأساليب الخاضعة للإشراف مثل OPSD بنسبة متوسطة تبلغ 3.2% و2.3% في الوضع غير المتفكر.
- في وضع التفكير، يساوي U-OPSD أو يتجاوز OPSD وGRPO، ويتفوق على الأخير بنسبة تصل إلى 1.1% عند المقياس 8B.
تُظهر هذه الطريقة أن التنقيح الذاتي الحقيقي ممكن من خلال الاتساق الداخلي، مما يوفر بديلاً تنافسيًا لإشارات التدريب الخاضع للإشراف.