저자들은 구조적으로 압축된 4비트 대규모 언어 모델의 추론 및 코딩 능력을 복원하는 방법인 양화 인식 치유(Quantization-Aware Healing, QAH)를 소개합니다. 표준 양화 인식 훈련이 압축된 모델을 다시 적합시키는 것과 달리, QAH는 원래 비압축 모델에서 4비트 학생 모델을 직접 증류합니다.
- MXFP4 양화를 사용하여 GPT-OSS 120B를 60B로 줄인 결과, 생성된 Hypernova-60B는 9개 벤치마크 중 7개에서 bfloat16 소스와 동등하거나 그 이상을 달성했습니다.
- 이 접근 방식은 가중치 메모리를 약 4분의 1 사용하고 교사의 매개변수 수의 절반만 사용합니다.
- QAH는 양화 인식 훈련과 비교할 만한 최고 성능에 약 7배 더 빠르게 도달하며, 손으로 조정된 조기 종료 없이 지속적인 훈련 중에도 안정적입니다.
이 방법은 여러 주에 걸친 하이퍼파라미터 검색 없이 압축된 모델을 배포하기 위한 실용적인 레시피를 제공합니다.