연구원들은 에지 배포에 적합한 컴팩트한 버전으로 대규모 비전-언어 모델을 증류하기 위한 마스크 점진적 강화 학습 프레임워크인 Masters를 제안합니다. 이 방법은 교사 및 학생 모델 간의 크기 차이로 인한 불안정성을 해결합니다.
- Masters는 교사의 비주도 가중치를 마스킹하여 복잡성을 줄이고, 훈련 중에 용량을 점진적으로 복원하여 더 부드러운 학습을 가능하게 합니다.
- 마스크된 교사로부터 사전 생성된 응답을 사용하여 오프라인 RL 단계를 통합함으로써 온라인 사고-답변 패러다임의 계산 비용을 피합니다.
- 프레임워크는 두 가지 보완적인 보상, 즉 응답 정확도에 대한 정확도 보상과 전이 용이성을 정량화하는 증류 보상을 사용합니다.
이 접근 방식은 학생들에게 긴 응답 생성 과정 없이도 풍부하지만 효율적인 가이드를 활용하여 강력한 성능을 달성할 수 있게 합니다.