Liquid AI ha lanzado LFM2.5-VL-3B, un modelo de visión y lenguaje de 3.1B de parámetros diseñado para un despliegue eficiente en dispositivos. El modelo lee pantallas digitales en entornos móviles, web y de escritorio, localiza objetos a coordenadas, analiza documentos y ejecuta llamadas a herramientas a partir de entradas de texto o imagen.

  • Rendimiento: Promedia 69.4 en 28 benchmarks de visión, igualando a InternVL-3.5-4B y quedándose atrás de Qwen3.5-4B por 0.7 puntos.
  • Nuevas capacidades: Introduce la llamada a funciones (ToolSandbox 59.5, BFCL v4 32.5) y una mejor localización (RefCOCO-avg 87.9).
  • Eficiencia: Cabe en ~3 GB de memoria, decodificando 228 tokens/s en Apple M5 Max.
  • Licencia: Uso comercial gratuito para empresas con ingresos anuales inferiores a $10M; las empresas más grandes deben negociar una licencia.

El modelo no es de razonamiento para mantener la latencia baja y se entrega en formatos nativos, GGUF, ONNX y MLX con soporte para llama.cpp, MLX, vLLM, SGLang y runtimes ONNX.