LFM2.5 团队发布了针对 LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B 模型的更新版 4 位 GGUF 检查点,这些模型采用量化感知蒸馏(QAD)进行训练。该技术将高精度教师模型的知识蒸馏到量化学生模型中,以恢复在标准量化过程中丢失的精度。
- QAD 在所有四种模型尺寸上恢复了 BF16 与标准 Q4_0 后训练量化之间性能差距的约 97%。
- 具体恢复率分别为:LFM2.5-230M 为 70.6%,LFM2.5-350M 为 73.4%,LFM2.5-1.2B 为 65.5%,LFM2.5-2.6B 为 48.4%。
- 在 GPQA Diamond、MMLU-Pro、IFEval、IFBench、Multi-IF、BFCLv4、GSM8K 和 AIME25 上进行了涵盖推理、指令遵循、工具使用和智能体能力的基准测试。
- 这些检查点在保持原生 Q4_0 GGUF 高吞吐量的同时,在测试的硬件后端上匹配或超越了 Q5_K_M 和 Q4_K_M 格式的质量。
这些更新使边缘设备能够在与全精度模型相比没有显著精度下降的情况下,保留低内存占用和高推理速度。