Liquid AI выпустила LFM2.5-VL-3B, модель визуального и языкового взаимодействия с 3 миллиардами параметров, предназначенную для обеспечения улучшенной и более быстрой производительности на периферийных устройствах. Модель сочетает в себе визуальный энкодер SigLIP2 400M NaFlex с основой её текстового аналога, обученной примерно на 34 триллионах токенов, включая в четыре раза больше визуальных данных по сравнению с предыдущими выпусками.
- Ключевые возможности включают улучшенное понимание экранов и интерфейсов, более точное определение местоположения объектов при обнаружении, рассуждения по нескольким изображениям и более надёжное вызов функций как в текстовых, так и в визуальных контекстах.
- Модель занимает около 3 ГБ памяти, декодируя со скоростью 228 токенов/с на M5 Max и 116 токенов/с на Ryzen AI Max+ 395, а также достигая 20 токенов/с на Galaxy S26 Ultra.
- При инференсе на GPU она достигает примерно 11K токенов в секунду при высокой конкурентности, что примерно вдвое превышает пропускную способность более крупных моделей класса 4B и опережает модели меньшего класса 2B.
Цель выпуска — предоставить мощное универсальное визуальное и языковое интеллектуальное решение для высоконагруженных задач на устройстве, с поддержкой фреймворков инференса, таких как llama.cpp, MLX, vLLM, SGLang и ONNX.