Liquid AI a publié LFM2.5-VL-3B, un modèle de vision et de langage de 3 milliards de paramètres conçu pour offrir des performances améliorées et plus rapides sur les appareils en périphérie. Le modèle associe un encodeur de vision SigLIP2 400M NaFlex à la structure principale de sa contrepartie uniquement textuelle, entraîné sur environ 34 billions de tokens, incluant quatre fois plus de données visuelles que les précédentes versions.
- Les capacités clés incluent une meilleure compréhension des écrans et des interfaces utilisateur, un meilleur ancrage pour la détection d'objets, le raisonnement multi-images et un appel de fonction plus robuste dans les contextes uniquement textuels et vision-texte.
- Le modèle tient dans environ 3 Go de mémoire, avec un débit de décodage de 228 tokens/s sur un M5 Max et 116 tokens/s sur un Ryzen AI Max+ 395, tout en atteignant 20 tokens/s sur un Galaxy S26 Ultra.
- En inférence GPU, il atteint environ 11K tokens par seconde à forte concurrence, ce qui représente environ le double du débit des modèles de classe 4B plus grands et devance les modèles de classe 2B plus petits.
Cette publication vise à fournir une intelligence visuelle et textuelle polyvalente et performante pour les charges de travail volumineuses sur appareil, avec un support dès le jour un pour les frameworks d'inférence tels que llama.cpp, MLX, vLLM, SGLang et ONNX.