Liquid AI 已为其 LFM2.5 系列中的三个模型发布了 DSpark 草稿模型检查点:LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B。这些草稿模型为现有目标模型添加了投机解码路径,允许一个约 300M 参数的草稿提出九个候选令牌块,由目标模型在一次前向传播中验证。
- 在不改变模型输出的情况下,该系统在 H100 上实现最高 3.18 倍的解码加速,在 M4 Max MacBook Pro 上实现最高 2.87 倍加速。
- 在贪婪解码下,生成的序列与单独运行的目标模型完全相同,确保基准测试准确性保持不变。
- DSpark 结合了 DFlash 风格的并行骨干网络、建模为马尔可夫链的轻量级顺序头部以及置信度调度的验证器。
- 在多工具函数调用场景中,LFM2.5-2.6B 的平均延迟降低了 57%,但由于当前实现限制,MoE 模型在 Apple silicon 上仅获得 1.18 倍的加速。
- 权重以 Safetensors 和 GGUF 格式提供,llama.cpp 和 SGLang 均提供首日支持。
该技术允许开发者显著降低本地编码助手、设备端代理和离线 Copilot 的推理延迟,同时通过自托管保持数据隐私。