연구자들은 온-폴리시 파워 디스틸레이션(OPPD)을 소개했는데, 이는 교사의 모델이 가진 날카로운 확률 분포를 모방하여 단일 패스로 고품질 답변을 생성하도록 모델을 훈련시키는 방법입니다. 이 접근 방식은 추론 시 광범위한 후보 샘플링의 필요성을 제거하면서 수학 및 코딩 벤치마크에서 성능을 크게 향상시킵니다.
- OPPD는 동결된 교사의 파워 분포 가중치가 학생 모델이 생성한 후보에 대해 최대 우도 업데이트를 수행하는 순차적 몬테카를로 샘플러를 사용합니다.
- 이 방법은 동일한 온도에서 훈련되지 않은 기준선과 비교하여 MATH500에서 최대 23.0점, GSM8K에서 27.3점의 단일 생성 정확도를 향상시킵니다.
- 디스틸레이션된 모델의 단일 생성은 64개의 후보를 사용한 파워 샘플링보다 우수하며, 훈련되지 않은 모델에서 16개의 후보가 제공하는 이득의 94퍼센트를 회복합니다.
- OPPD는 참조 답변을 사용하지 않고 MATH500, GSM8K 및 AIME에서 검증된 보상과 함께 훈련된 GRPO보다 높은 점수를 얻으며, GRPO 적용 후 최대 9.3점을 추가할 수 있습니다.
- 이 기법은 HumanEval 정확도를 최대 5.3점까지 높이며 서로 다른 모델 계열과 크기 전반에 걸쳐 이득을 유지합니다.
이 방법을 통해 모델은 무거운 샘플링이나 추가 참조 데이터가 일반적으로 필요한 추론 개선을 직접적인 매개변수 업데이트를 통해 달성할 수 있습니다.