Hugging Face 포럼의 한 사용자가 점진적 지식 전이에 대한 실험을 제안합니다. 이는 고정 크기의 학생 모델(Qwen 4B)이 가장 큰 사용 가능한 모델에서 직접 학습하는 대신, 점점 더 큰 교사 모델로부터 순차적으로 학습하는 방식입니다.
- 이 과정은 4B 모델이 Qwen 8B 또는 9B에서 학습한 후 해당 교사를 폐기하고 Qwen 12B에서 학습하며, 이후 Qwen 27B에서 학습하는 것을 포함합니다.
- 이 접근법은 큰 능력 격차를 한 번에 극복하려고 시도하는 대신 이전에 습득한 지식을 바탕으로 구축함으로써 인간의 학습 방식을 모방합니다.
- 제안된 방법은 이미 학습된 특성을 재발견하는 것을 피하면서 유용한 능력을 식별하고 추가하기 위해 "검색 및 강화" 전략을 사용하는 Heretic 프로젝트와 유사한 방법을 사용합니다.
- 성공 여부는 고정 크기 모델이 측정 가능한 개선을 이루고 이전의 성과를 보존하는지에 따라 평가되며, 이는 소형 모델의 실제 지식 용량에 대한 통찰력을 제공합니다.
저자는 이 방법이 점진적인 지식 축적이 소형 모델에게 가장 큰 교사로부터 직접 증류하는 것보다 더 효과적인지 여부를 결정할 수 있다고 제안합니다.