LFM2.5-VL-3B — это новая модель «зрение-язык», которая демонстрирует конкурентоспособные результаты по сравнению с более крупными моделями, сохраняя при этом низкую задержку для приложений реального времени и устройств на базе мобильных процессоров. Она построена на основе предыдущего релиза LFM2-VL-3B с существенными улучшениями в понимании экрана, привязке к объектам, вызове функций и поддержке ввода нескольких изображений.

  • Средний балл понимания экранов/интерфейсов составляет 80.7 по ScreenSpot-v2, превосходя Gemma-4-E4B (51.2) и Qwen 3.5 4B (78.5).
  • Баллы за вызов функций выросли более чем вдвое: с 26.4 до 59.5 на ToolSandbox и достигли 32.5 на BFCL v4.
  • Точность Grounding@1 по RefCOCO увеличилась с 57.1 до 87.9 благодаря масштабированию синтетических данных.
  • Многоизображенное рассуждение улучшило баллы BLINK с 50.2 до 61.5 и MUIRBench с 34.9 до 58.3.
  • Модель декодирует 228 токенов/с на Apple M5 Max и 20 токенов/с на Galaxy S26 Ultra, используя около 3 ГБ памяти.

Архитектура без механизма рассуждений обеспечивает быстрый ответ первого токена, что делает её подходящей для приватного вывода на устройстве и обслуживания с высокой пропускной способностью на GPU.