O LFM2.5-VL-3B é um novo modelo de visão e linguagem que oferece desempenho competitivo em comparação com modelos maiores, mantendo baixa latência para aplicações em tempo real e em dispositivos. Ele se baseia na versão anterior do LFM2-VL-3B com melhorias significativas na compreensão de tela, fundamentação (grounding), chamada de funções e capacidades de entrada de múltiplas imagens.
- A compreensão de tela/Interface Usuária (UI) tem média de 80,7 no ScreenSpot-v2, superando o Gemma-4-E4B (51,2) e o Qwen 3.5 4B (78,5).
- A pontuação de chamada de funções mais que dobra, passando de 26,4 para 59,5 no ToolSandbox e subindo para 32,5 no BFCL v4.
- A precisão do grounding@1 no RefCOCO aumenta de 57,1 para 87,9 por meio de dados sintéticos em escala.
- O raciocínio com múltiplas imagens melhora as pontuações do BLINK de 50,2 para 61,5 e do MUIRBench de 34,9 para 58,3.
- O modelo decodifica 228 tokens/s no Apple M5 Max e 20 tokens/s no Galaxy S26 Ultra, utilizando aproximadamente 3 GB de memória.
A arquitetura sem raciocínio garante respostas rápidas do primeiro token, tornando-a adequada para inferência privada em dispositivos e atendimento de GPU com alta taxa de transferência.