LFM2.5-VL-3B는 실시간 및 온디바이스 애플리케이션을 위한 낮은 지연 시간을 유지하면서 더 큰 모델들과 경쟁력 있는 성능을 제공하는 새로운 비전-라틴어 모델입니다. 이 모델은 이전 LFM2-VL-3B 릴리스를 기반으로 화면 이해, 그라운딩, 함수 호출, 다중 이미지 입력 기능에서 상당한 개선을 이루었습니다.
- Screen/UI 이해도는 ScreenSpot-v2에서 평균 80.7로, Gemma-4-E4B(51.2)와 Qwen 3.5 4B(78.5)를 능가합니다.
- ToolSandbox에서 함수 호출 점수가 26.4에서 59.5로 두 배 이상 증가했으며, BFCL v4에서는 32.5까지 상승했습니다.
- 확장된 합성 데이터를 통해 RefCOCO의 Grounding precision@1이 57.1에서 87.9로 향상되었습니다.
- 다중 이미지 추론은 BLINK 점수를 50.2에서 61.5로, MUIRBench를 34.9에서 58.3으로 개선했습니다.
- 이 모델은 Apple M5 Max에서 초당 228 토큰을, Galaxy S26 Ultra에서 초당 20 토큰을 디코딩하며, 약 3 GB의 메모리를 사용합니다.
비추론 아키텍처는 빠른 첫 번째 토큰 응답을 보장하여 프라이빗 온디바이스 추론과 고통량 GPU 서빙에 적합합니다.