本文介绍了量化感知修复(Quantization-Aware Healing),这是一种创建压缩4位模型的方法,其性能优于其全精度原始模型。
该方法表明,特定的量化技术可以增强模型能力,使其超出基线未量化版本。
本文介绍了量化感知修复(Quantization-Aware Healing),这是一种创建压缩4位模型的方法,其性能优于其全精度原始模型。
该方法表明,特定的量化技术可以增强模型能力,使其超出基线未量化版本。
Meta发布了MobileMoE,这是一组专为移动设备优化的混合专家(MoE)语言模型,旨在优化移动设备上的质量与效率平衡。该系列包含三个模型规模,具有亚十亿级激活参数,INT4格式下的权重体积小于3 GB。
作者介绍了量化感知修复(QAH),一种直接从 uncompressed 模型中蒸馏4位学生以恢复在结构压缩和量化过程中丢失的性能的管道。应用于 GPT-OSS 120B,该方法生成了 Hypernova-60B,它在9个基准测试中的7个上与 bfloat16 源相匹配或超越,同时使用的权重内存大约减少了4倍。
作者提出了量化感知修复(QAH),一种用于恢复结构压缩的4位大语言模型的推理和编码能力的方法。与重新拟合压缩模型的标准量化感知训练不同,QAH直接从原始未压缩模型中蒸馏出4位学生模型。
Joakimpalm-Zen 已更新 Xyntetik Runner,使其能够直接使用其用于推理的相同量化 GGUF 权重来训练 LoRA 适配器,从而无需单独的 FP16 训练副本或运行时。
Liquid AI 已为其 LFM2.5 系列中的三个模型发布了 DSpark 草稿模型检查点:LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B。这些草稿模型为现有目标模型添加了投机解码路径,允许一个约 300M 参数的草稿提出九个候选令牌块,由目标模型在一次前向传播中验证。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策