A Liquid AI lançou o LFM2.5-VL-3B, um modelo de visão e linguagem com 3,1 bilhões de parâmetros projetado para implantação eficiente em dispositivos. O modelo lê telas digitais em ambientes móveis, web e desktop, localiza objetos em coordenadas, analisa documentos e executa chamadas de ferramentas a partir de entradas de texto ou imagem.

  • Desempenho: Média de 69,4 em 28 benchmarks de visão, igualando o InternVL-3.5-4B e ficando atrás do Qwen3.5-4B por 0,7 pontos.
  • Novas Capacidades: Introduz chamada de funções (ToolSandbox 59,5, BFCL v4 32,5) e melhor localização (RefCOCO-avg 87,9).
  • Eficiência: Cabe em ~3 GB de memória, decodificando 228 tok/s no Apple M5 Max.
  • Licenciamento: Uso comercial gratuito para empresas com receita anual inferior a $10M; grandes empresas devem negociar uma licença.

O modelo não é de raciocínio para manter a latência baixa e é disponibilizado nos formatos nativo, GGUF, ONNX e MLX, com suporte para llama.cpp, MLX, vLLM, SGLang e runtimes ONNX.