Liquid AI 发布了 LFM2.5-VL-3B,这是一个拥有 30 亿参数的视觉语言模型,旨在为边缘设备提供更优且更快的性能。该模型将 SigLIP2 400M NaFlex 视觉编码器与其纯文本对应模型的骨干网络相结合,并在约 34 万亿个 token 上进行了训练,其中包含比之前发布版本多四倍的视觉数据。

  • 关键能力包括增强的屏幕和 UI 理解、改进的对象检测接地(grounding)、多图推理以及在纯文本和视觉-文本上下文中的更强函数调用能力。
  • 该模型仅需约 3 GB 内存即可运行,在 M5 Max 上解码速度为 228 tok/s,在 Ryzen AI Max+ 395 上为 116 tok/s,而在 Galaxy S26 Ultra 上达到 20 tok/s。
  • 在 GPU 推理方面,它在高并发下可实现每秒约 11K token,吞吐量约为更大的 4B 级模型的两倍,并优于较小的 2B 级模型。

此次发布旨在为高容量的设备端工作负载提供强大的通用视觉语言智能,并为 llama.cpp、MLX、vLLM、SGLang 和 ONNX 等推理框架提供首日支持。