作者介绍了量化感知修复(QAH),一种直接从 uncompressed 模型中蒸馏4位学生以恢复在结构压缩和量化过程中丢失的性能的管道。应用于 GPT-OSS 120B,该方法生成了 Hypernova-60B,它在9个基准测试中的7个上与 bfloat16 源相匹配或超越,同时使用的权重内存大约减少了4倍。
- QAH 直接从原始 uncompressed 模型中蒸馏学生,而不是重新拟合压缩检查点的硬标签。
- 该方法达到可比峰值性能的速度比量化感知训练(QAT)快约7倍,并且在持续训练下保持稳定。
- Hypernova-60B 作为开放权重模型发布,参数量是教师的一半。
作者旨在提供一种可部署的配方,避免多周的超参数搜索,并注意到分布式训练后端之间存在显著的质量差距。