يقدم الباحثون منطقة تحسين السياسة القريبة (ZPPO)، وهي طريقة تُدخل معرفة المعلم في المطالبات بدلاً من تدرجات السياسة لمعالجة الهشاشة في تقطير المعرفة والانحراف في التعلم المعزز. يبني ZPPO أسئلة تتضمن مرشحين ثنائيين (BCQ) وأسئلة تتضمن مرشحين سلبيين (NCQ) للأسئلة الصعبة، ويعيد تدويرها عبر مخزن الاسترجاع حتى تتحسن دقة الطالب أو يتم إخراجها.
- يقترن ZPPO استجابة معلم صحيحة واحدة مع استجابة طالب خاطئة في BCQ لإجبار التمييز، بينما تجمع NCQ إخفاقات الطالب لتسليط الضوء على أنماط الأخطاء المشتركة.
- تم اختبار الطريقة على عائلة Qwen3.5 بمقاييس تتراوح من 0.8B إلى 9B باستخدام نموذج معلم بحجم 27B.
- شملت التقييمات مجموعة مكونة من 31 معياراً تشمل 16 مهمة VLM، و10 مهام LLM، و5 مهام فيديو.
- تفوق ZPPO على تقطير السياسة الخارجية/الداخلية وGRPO، مع أكبر المكاسب التي لوحظت عند أصغر حجم للنموذج.
من خلال إبقاء المعلم داخل المطالبة بدلاً من تدرج السياسة، يتجنب ZPPO الانهيار في افتراضات السياسة الداخلية بينما يعزز التعلم ضمن المنطقة القريبة من التطور الحالية للطالب.