저자들은 Quantization-Aware Healing (QAH)을 소개했습니다. 이는 구조적 압축 및 양자화 동안 손실된 성능을 회복하기 위해 비압축 모델에서 직접 4비트 학생 모델을 증류하는 파이프라인입니다. GPT-OSS 120B에 적용하면 이 방법은 Hypernova-60B를 생성하며, 9개 벤치마크 중 7개에서 bfloat16 소스와 동등하거나 더 나은 성능을 보이며 가중치 메모리를 약 4배 적게 사용합니다.

  • QAH은 압축된 체크포인트를 하드 레이블에 다시 적합시키는 대신 원래 비압축 모델에서 직접 학생을 증류합니다.
  • 이 접근 방식은 양자화 인식 훈련(QAT)보다 약 7배 빠르게 최고 성능에 도달하며 지속적 훈련 하에서도 안정적입니다.
  • Hypernova-60B는 교사의 절반 파라미터 수를 가진 오픈 웨이트 모델로 출시되었습니다.

저자들은 분산 학습 백엔드 간의 상당한 품질 격차를 지적하며, 여러 주에 걸친 하이퍼파라미터 검색을 피할 수 있는 배포 가능한 레시피를 제공하고자 합니다.