Liquid AI 已开源其 LFM2.5 系列的 DSpark 草稿模型,支持推测解码,在 GPU 上吞吐量最高提升 3.18 倍,在设备上最高提升 2.87 倍。

  • DSpark 架构结合并行主干、轻量级顺序头部和置信度调度验证器,以降低内存受限解码阶段的延迟。
  • 提供对 llama.cpp 和 SGLang 的首日支持,允许用户以最小的配置更改运行这些模型。
  • 在 M4 Max MacBook Pro 上,LFM2.5-2.6B 的速度超过 140 tok/s,而函数调用的平均延迟降低了 57%。
  • 草稿模型检查点提供 Safetensors 和 GGUF 格式,适用于各种 LFM2.5 尺寸,包括 1.2B、2.6B 和 8B。

该集成允许用户在本地或加速器上部署高效智能体推理,而不牺牲贪婪解码的准确性。