A Liquid AI lançou o LFM2.5-VL-3B, um modelo de visão e linguagem com 3 bilhões de parâmetros projetado para oferecer desempenho melhorado e mais rápido em dispositivos de borda. O modelo combina um codificador de visão SigLIP2 400M NaFlex com a estrutura principal de sua contraparte apenas de texto, treinado em aproximadamente 34 trilhões de tokens, incluindo quatro vezes mais dados de visão do que lançamentos anteriores.
- As principais capacidades incluem compreensão aprimorada de telas e interfaces do usuário, melhor fundamentação para detecção de objetos, raciocínio com múltiplas imagens e chamada de funções mais robusta em contextos apenas de texto e de visão-texto.
- O modelo cabe em cerca de 3 GB de memória, decodificando a 228 tokens/s em um M5 Max e 116 tokens/s em um Ryzen AI Max+ 395, enquanto atinge 20 tokens/s em um Galaxy S26 Ultra.
- Na inferência com GPU, ele alcança aproximadamente 11K tokens por segundo em alta concorrência, o que é cerca de duas vezes a taxa de transferência de modelos maiores da classe 4B e superior aos modelos menores da classe 2B.
O lançamento visa fornecer inteligência de visão e linguagem geral e robusta para cargas de trabalho on-device de alto volume, com suporte imediato para frameworks de inferência como llama.cpp, MLX, vLLM, SGLang e ONNX.