作者提出了量化感知修复(QAH),一种用于恢复结构压缩的4位大语言模型的推理和编码能力的方法。与重新拟合压缩模型的标准量化感知训练不同,QAH直接从原始未压缩模型中蒸馏出4位学生模型。
- 应用于通过MXFP4量化将GPT-OSS 120B缩减至60B后,生成的Hypernova-60B在9个基准测试中的7个上与bfloat16源模型持平或超越。
- 该方法使用的权重内存约为原来的四分之一,参数量仅为教师模型的一半。
- QAH达到与量化感知训练相当的峰值性能的速度快约7倍,并且在持续训练过程中保持稳定,无需手动调整早停。
该方法为部署压缩模型提供了一种实用方案,无需进行长达数周的超参数搜索。