LFM2.5-VL-3B es un nuevo modelo de visión-lenguaje que ofrece un rendimiento competitivo frente a modelos más grandes mientras mantiene una baja latencia para aplicaciones en tiempo real y en dispositivo. Se basa en la versión anterior LFM2-VL-3B con mejoras significativas en la comprensión de pantallas, anclaje, invocación de funciones y capacidades de entrada multi-imagen.

  • La comprensión de pantalla/UI promedia 80.7 en ScreenSpot-v2, superando a Gemma-4-E4B (51.2) y Qwen 3.5 4B (78.5).
  • Las puntuaciones de invocación de funciones se duplican más del doble, pasando de 26.4 a 59.5 en ToolSandbox y ascendiendo a 32.5 en BFCL v4.
  • La precisión@1 de anclaje en RefCOCO aumenta de 57.1 a 87.9 mediante datos sintéticos escalados.
  • El razonamiento multi-imagen mejora las puntuaciones BLINK de 50.2 a 61.5 y MUIRBench de 34.9 a 58.3.
  • El modelo decodifica 228 tokens/s en Apple M5 Max y 20 tokens/s en Galaxy S26 Ultra, utilizando aproximadamente 3 GB de memoria.

La arquitectura sin razonamiento garantiza respuestas rápidas del primer token, lo que la hace adecuada para inferencia privada en dispositivo y servicio GPU de alto rendimiento.