연구자들은 지식 증류의 취약성과 강화학습에서의 드리프트(drift) 문제를 해결하기 위해 정책 그래디언트가 아닌 프롬프트에 교사 지식을 주입하는 방법인 근접 정책 최적화 영역(Zone of Proximal Policy Optimization, ZPPO)을 소개한다. ZPPO는 어려운 질문에 대해 이진 후보 포함 질문(Binary Candidate-included Questions, BCQ)과 부정 후보 포함 질문(Negative Candidate-included Questions, NCQ)을 구성하고, 학생의 정확도가 향상되거나 제외될 때까지 리플레이 버퍼를 통해 이를 순환시킨다.

  • ZPPO는 BCQ에서 하나의 올바른 교사 응답과 잘못된 학생 응답을 짝지어 판별력을 강화하며, NCQ는 학생의 실패를 집계하여 공통된 오류 패턴을 드러낸다.
  • 이 방법은 27B 교사 모델을 사용하여 0.8B에서 9B 규모의 Qwen3.5 계열 모델에서 테스트되었다.
  • 평가에는 16개 VLM, 10개 LLM, 5개 비디오 작업을 포함한 31개 벤치마크 스위트가 포함되었다.
  • ZPPO는 오프/온-정책 증류 및 GRPO를 능가했으며, 가장 큰 성능 향상은 가장 작은 모델 규모에서 관찰되었다.

교사 지식을 정책 그래디언트가 아닌 프롬프트 내부에 유지함으로써 ZPPO는 온-정책 가정의 붕괴를 피하면서도 학생의 현재 근접 발달 영역 내 학습을 증폭시킨다.