Liquid AI выпустила LFM2.5-VL-3B, модель для распознавания изображений и текста с 3,1 млрд параметров, предназначенную для эффективного развёртывания на устройстве. Модель анализирует цифровые экраны в мобильных, веб- и десктопных средах, определяет координаты объектов, парсит документы и выполняет вызовы инструментов на основе текстовых или визуальных входных данных.

  • Производительность: среднее значение 69,4 по 28 бенчмаркам для работы с изображениями, что соответствует InternVL-3.5-4B и уступает Qwen3.5-4B на 0,7 балла.
  • Новые возможности: добавлена поддержка вызова функций (ToolSandbox 59,5, BFCL v4 32,5) и улучшено определение координат объектов (RefCOCO-avg 87,9).
  • Эффективность: занимает около 3 ГБ памяти, декодирует 228 токенов/с на чипе Apple M5 Max.
  • Лицензирование: бесплатное коммерческое использование для компаний с годовой выручкой до 10 млн долларов; более крупные предприятия должны заключать лицензионное соглашение.

Модель не использует рассуждения, чтобы поддерживать низкую задержку. Она доступна в нативном формате, а также в форматах GGUF, ONNX и MLX с поддержкой библиотек llama.cpp, MLX, vLLM, SGLang и сред выполнения ONNX.