이 기사는 완전 정밀 원본보다 우수한 성능을 달성하는 압축된 4비트 모델을 생성하기 위한 Quantization-Aware Healing 방법을 소개합니다.

이 접근 방식은 특정 양자화 기술이 기본 비양자화 버전의 한계를 넘어 모델 능력을 향상시킬 수 있음을 보여줍니다.