LFM2.5-VL-3B améliore la compréhension d'écran et l'appel de fonctions pour le déploiement en périphérie
LFM2.5-VL-3B est un nouveau modèle vision-langue qui offre des performances compétitives face à des modèles plus grands tout en maintenant une faible latence pour les applications temps réel et sur appareil. Il s'appuie sur la précédente version LFM2-VL-3B avec des améliorations significatives dans la compréhension d'écran, l'ancrage (grounding), l'appel de fonctions et les capacités d'entrée multi-images.