연구자들은 표준 온파시얼리 디스틸레이션에서 학생의 오류가 신뢰할 수 없는 감독을 초래하는 접두사 실패 문제를 해결하기 위해 Relay On-Policy Distillation (Relay-OPD)를 소개했습니다. 이 방법은 교사-학생 연속성 비대칭을 트리거로 사용하여, 학생이 재개하기 전에 교사가 잠시 개입하여 궤적을 재지시합니다.

  • 여덟 가지 수학적 추론 벤치마크에서 Qwen3-4B-Instruct-2507 교사와 Qwen3-0.6B/1.7B-Non-Thinking 학생을 활용합니다.
  • 모든 벤치마크에서 최고 또는 준최고의 결과를 달성하며, 1.7B 모델 기준 표준 OPD 대비 평균 +5.73%, FastOPD 대비 +1.49% 향상되었습니다.
  • 0.6B 규모에서도 일관된 성능 향상이 관찰되었으며, 학습 궤적 길이는 50% 이상 단축되었습니다.

이 접근법은 제한된 릴레이 예산을 통해 중요한 초기 단계에 개입을 집중함으로써 학생 정책과의 편차를 최소화하면서도 효율성과 정확성을 크게 개선합니다.