연구자들은 외부 감독 없이 모델의 자체 생성만 사용하여 대규모 언어 모델(LLM)의 사후 학습 성능을 향상시키는 방법인 비지도 온-폴리시 자기 증류(Unsupervised On-Policy Self-Distillation, U-OPSD)를 제안한다. 이 접근법은 다중 롤아웃을 샘플링하여 과반수 투표를 통해 의사 정답(pseudo-solution)을 구성한 후, 모델의 가장 긴 오답 완료 구문의 접두사 부분에 교사 분포를 증류(distill)한다.
- U-OPSD는 AIME24, MATH500, AMC23 등의 벤치마크에서 Qwen3 비사고(non-thinking) 모드 4B 및 8B 스케일에서 기본 모델을 각각 8.5%, 10.7% 향상시킨다.
- 비사고 모드에서 OPSD와 같은 지도 학습 방법보다 평균 3.2%, 2.3% 더 우수한 성능을 보인다.
- 사고(thinking) 모드에서는 U-OPSD가 OPSD와 GRPO를 따라잡거나 초과하며, 8B 스케일에서 후자보다 최대 1.1% 우위를 점한다.
이 방법은 내부적 일관성을 통해 진정한 자기 증류가 가능함을 보여주며, 지도 학습 신호에 대한 경쟁력 있는 대안을 제시한다.