Liquid AI 发布了 LFM2.5-VL-3B,这是一款拥有 31 亿参数的视觉语言模型,专为高效的端侧部署而设计。该模型能够读取移动、网页和桌面环境中的数字屏幕,将物体定位到坐标,解析文档,并根据文本或图像输入执行工具调用。
- 性能:在 28 个视觉基准测试中平均得分为 69.4,与 InternVL-3.5-4B 持平,落后于 Qwen3.5-4B 0.7 分。
- 新功能:引入函数调用(ToolSandbox 59.5,BFCL v4 32.5)和改进的定位能力(RefCOCO-avg 87.9)。
- 效率:仅需约 3 GB 内存,在 Apple M5 Max 上解码速度达 228 tok/s。
- 许可:年收入低于 1000 万美元的公司可免费用于商业用途;大型企业需协商授权协议。
该模型为非推理型以保持低延迟,并提供原生、GGUF、ONNX 和 MLX 格式,支持 llama.cpp、MLX、vLLM 和 ONNX 运行时。