Liquid AI 已为其 LFM2.5 系列发布了草稿模型检查点——具体包括 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B——这些模型利用推测解码在确保输出质量的同时显著提升推理速度。
- DSpark 方法结合并行主干网络、轻量级顺序头部和置信度调度验证器,通过牺牲少量内存换取吞吐量大幅提升,从而降低延迟。
- 基准测试显示,在 NVIDIA H100 GPU 上吞吐量提升高达 3.18 倍,在 M4 Max MacBook Pro 等边缘设备上提升高达 2.87 倍。
- 对于涉及函数调用的智能体工作负载,DSpark 在 BFCL 数据集上将延迟平均降低了 57%。
- 这些草稿模型已在 llama.cpp 和 SGLang 中开源上游代码,检查点可在 Hugging Face 上以 Safetensors 和 GGUF 格式获取。
此次发布旨在通过提供对高效边缘推理和高吞吐量 GPU 服务的一流支持,使 LFM2.5 适用于设备端智能体应用。