Liquid AI 发布了 LFM2.5-VL-3B-DSpark,这是为其 LFM2.5-VL-3B 视觉语言模型设计的实验性推测解码草稿模型。该草稿模型增加了约 280M 参数,在不改变模型输出分布的情况下加速了 token 生成。
- 拥有 279.5M 参数的草稿模型采用简化的纯注意力架构,包含 4 层,使部署的总参数量增加 8.9%。
- 在 Apple M5 Max 芯片上解码速度最高提升 3.13 倍,在 NVIDIA H100 GPU 上提升 2.66 倍,但由于图像编码时间固定,端到端增益较低。
- 权重以 Safetensors 和 GGUF 格式提供,并在一开始就支持 SGLang、MLX-VLM 和 llama.cpp,遵循 LFM Open License v1.0 许可。
- 在贪婪解码下输出与基础模型完全相同,而较高的温度会降低接受率和吞吐量。
此次发布允许用户在兼容硬件上显著加快推理速度,Liquid AI 指出预填充和视觉编码阶段仍未加速。