LFM2.5-VL-3B est un nouveau modèle vision-langue qui offre des performances compétitives face à des modèles plus grands tout en maintenant une faible latence pour les applications temps réel et sur appareil. Il s'appuie sur la précédente version LFM2-VL-3B avec des améliorations significatives dans la compréhension d'écran, l'ancrage (grounding), l'appel de fonctions et les capacités d'entrée multi-images.
- La compréhension d'écran/UI atteint une moyenne de 80,7 sur ScreenSpot-v2, surpassant Gemma-4-E4B (51,2) et Qwen 3.5 4B (78,5).
- Les scores d'appel de fonctions plus que doublent, passant de 26,4 à 59,5 sur ToolSandbox et atteignant 32,5 sur BFCL v4.
- La précision Grounding@1 sur RefCOCO augmente de 57,1 à 87,9 grâce à des données synthétiques à grande échelle.
- Le raisonnement multi-images améliore les scores BLINK de 50,2 à 61,5 et MUIRBench de 34,9 à 58,3.
- Le modèle décode 228 tok/s sur Apple M5 Max et 20 tok/s sur Galaxy S26 Ultra, en utilisant environ 3 Go de mémoire.
L'architecture sans raisonnement garantit des réponses rapides au premier jet, ce qui la rend adaptée à l'inférence privée sur appareil et au service GPU à haut débit.