Multiverse Computing 推出了量化感知修复(QAH),这是一种直接从原始预压缩教师模型中蒸馏压缩、量化大语言模型的方法。将其应用于压缩至 60B 参数并量化为 MXFP4 的 GPT-OSS 120B 模型时,该方法产生的模型在 9 项基准测试中的 7 项上优于其自身的 bfloat16 全精度版本。
- QAH 模型在 LiveCodeBench(66.5 vs. 66.0)上超越原始 120B 教师模型,并在长上下文推理(AA-LCR +7.4)和数学(AIME 2025 +5.6)方面取得显著提升。
- 与量化感知训练(QAT)相比,QAH 在约 100 步内达到峰值性能,速度提高约 7 倍,同时避免了 QAT 在第 700 步后出现的严重精度崩溃。
- 该方法使用内存高效的块状 KL 散度损失来处理长达 32k token 的长上下文修复,而无需显式构建完整的词汇-序列网格。
该技术使压缩模型比未压缩的对应模型更小、服务成本更低且更准确,有效地逆转了效率与能力之间的常规权衡。