연구자들은 온-폴리시 파워 디스틸레이션(OPPD)이라는 방법을 소개했는데, 이는 교사 모델의 날카로워진 확률 분포를 모방하여 언어 모델이 단 한 번의 패스로 고품질 답변을 생성하도록 훈련시키는 방법입니다. 이 접근 방식은 추론 시 광범위한 후보 샘플링의 필요성을 제거하면서도 추론 작업에서 성능을 크게 향상시킵니다.
- OPPD는 동결된 교사의 파워 분포가 훈련 중인 모델이 생성한 후보에 가중치를 부여하는 순차적 몬테 카를로 샘플러를 사용합니다.
- 이 방법은 동일한 온도에서 훈련되지 않은 모델과 비교하여 MATH500에서 최대 23.0점, GSM8K에서 27.3점의 단일 생성 정확도를 향상시킵니다.
- 디스틸된 모델의 단일 생성은 64개의 후보를 사용한 공개된 파워 샘플링보다 우수하며, 훈련되지 않은 모델에서 16개의 후보가 제공하는 이득의 94%를 회복합니다.
- OPPD는 참조 답변 없이 MATH500, GSM8K, AIME에서 GRPO보다 높은 점수를 얻으며, GRPO 적용 후 최대 9.3점을 추가할 수 있습니다.
- 이 기법은 HumanEval 정확도를 최대 5.3점까지 높이며, 다양한 모델 계열과 크기에서 작동합니다.
OPPD는 모델의 아키텍처를 변경하거나 검색 기반 추론을 요구하지 않고도 추론 능력을 향상시키는 매개변수 효율적인 방법을 제공합니다.