Liquid AI ha lanzado LFM2.5-VL-3B, un modelo de visión y lenguaje de 3 mil millones de parámetros diseñado para ofrecer un rendimiento mejorado y más rápido en dispositivos del borde. El modelo combina un codificador de visión SigLIP2 400M NaFlex con la columna vertebral de su contraparte solo de texto, entrenado con aproximadamente 34 billones de tokens que incluyen cuatro veces más datos de visión que los lanzamientos anteriores.

  • Las capacidades clave incluyen una mejor comprensión de pantallas e interfaces de usuario, un anclaje mejorado para la detección de objetos, razonamiento con múltiples imágenes y llamadas a funciones más sólidas en contextos solo de texto y de visión-texto.
  • El modelo cabe en aproximadamente 3 GB de memoria, decodificando a 228 tokens/s en un M5 Max y 116 tokens/s en un Ryzen AI Max+ 395, mientras alcanza 20 tokens/s en un Galaxy S26 Ultra.
  • En inferencia con GPU, logra aproximadamente 11K tokens por segundo a alta concurrencia, lo que es aproximadamente el doble del rendimiento de modelos de clase 4B más grandes y supera a los modelos de clase 2B más pequeños.

El lanzamiento tiene como objetivo proporcionar una inteligencia de visión y lenguaje generalista y sólida para cargas de trabajo en dispositivo de alto volumen, con soporte desde el primer día para marcos de inferencia como llama.cpp, MLX, vLLM, SGLang y ONNX.