Liquid AI 发布了 LFM2.5-VL-DSpark 草稿模型,这是一种推测解码的草稿生成器,旨在加速 LFM2.5-VL-3B 视觉语言模型的推理。该草稿生成器从目标模型的固定层捕获隐藏状态以生成候选 token,仅增加 280M 参数(开销为 8.9%),同时保持跨模态的维度一致。

  • 在 Apple M5 Max 设备上解码速度提升高达 3.13 倍,在 NVIDIA H100 GPU 上提升 2.66 倍。
  • 端到端延迟改进:设备端为 1.56 倍至 2.62 倍,GPU 端为 1.64 倍至 2.27 倍。
  • 该模型提供对 llama.cpp、MLX-VLM 和 SGLang 的首日集成支持。
  • 推测解码仅加速解码阶段;预填充和视觉编码在边缘设备上仍是计算瓶颈。

此次发布使得开放权重的视觉语言模型能够在各种硬件环境中更快部署,且不限制微调或分发。