Liquid AI 发布了其视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,能够在不改变输出质量的情况下加速边缘设备和 GPU 上的解码。

该草稿模型使部署模型的参数量增加约 8.9%,并在 H100 GPU 上实现高达 2.66x 的解码吞吐量提升,在 Apple Silicon 边缘设备上实现 3.13x 的提升。

端到端吞吐量增益在 GPU 上达到 2.27x,在边缘硬件上达到 2.62x,系统在 SGLang 的不同并发级别下保持吞吐量优势。

作者指出,推测解码仅加速解码阶段,这意味着视觉编码和预填充成本保持不变,这限制了资源受限的边缘设备上的整体延迟改进。