Liquid AI a publié LFM2.5-VL-3B, un modèle vision-langue de 3,1 milliards de paramètres conçu pour un déploiement efficace sur appareil. Le modèle lit des écrans numériques dans les environnements mobiles, web et de bureau, ancre les objets à des coordonnées, analyse des documents et exécute des appels d'outils à partir d'entrées textuelles ou image.
- Performance : Moyenne de 69,4 sur 28 benchmarks vision, égale à InternVL-3.5-4B et en retard de 0,7 point par rapport à Qwen3.5-4B.
- Nouvelles capacités : Introduit l'appel de fonctions (ToolSandbox 59,5, BFCL v4 32,5) et un meilleur ancrage (RefCOCO-avg 87,9).
- Efficacité : Tient dans ~3 Go de mémoire, décode 228 tok/s sur Apple M5 Max.
- Licence : Utilisation commerciale gratuite pour les entreprises avec un chiffre d'affaires annuel inférieur à 10 millions de dollars ; les grandes entreprises doivent négocier une licence.
Le modèle est non-raisonnant pour maintenir une faible latence et est livré dans les formats natifs, GGUF, ONNX et MLX avec prise en charge des runtimes llama.cpp, MLX, vLLM, SGLang et ONNX.