LFM2.5-VL-3B是一款新的视觉语言模型,在保持低延迟以支持实时和端侧应用的同时,展现出可与更大规模模型相媲美的性能。该模型基于之前的LFM2-VL-3B版本发布,在屏幕理解、定位、函数调用和多图像输入能力方面进行了显著增强。
- 在ScreenSpot-v2上,屏幕/UI理解的平均得分为80.7,优于Gemma-4-E4B(51.2)和Qwen 3.5 4B(78.5)。
- 在ToolSandbox上,函数调用得分从26.4翻倍至59.5,并在BFCL v4上攀升至32.5。
- 通过扩展合成数据,RefCOCO上的定位precision@1从57.1提升至87.9。
- 多图像推理能力得到提升,BLINK得分从50.2增至61.5,MUIRBench从34.9增至58.3。
- 该模型在Apple M5 Max上解码速度为228 tok/s,在Galaxy S26 Ultra上为20 tok/s,内存占用约为3 GB。
非推理架构确保了快速的第一个token响应,使其适用于私有端侧推理和高吞吐量GPU服务。