Проект llama.cpp добавил поддержку модели embeddingGemma2, которая обрабатывает текстовые, визуальные и аудиовходные данные. Это обновление реализовано через pull request #30054.
llama.cpp добавляет поддержку мультимодальных эмбеддингов embeddingGemma2
llama.cpp v0.6.0 добавляет расширенный API пакетов, поддержку GLM-5.3-Flash и конечные точки моделей принятия решений
llama.cpp v0.6.0 представляет новый расширенный API пакетов llama_batch_ext для смешанных входных данных токенов и эмбеддингов, а также поддержку гибридной модели GLM-5.3-Flash 320B и модели принятия решений Clef.
llama.cpp b11240 добавляет поддержку типизированного мультимодального ввода для /v1/embeddings
Сервер llama.cpp теперь поддерживает ввод типизированного контента (визуальный, аудио, видео) для конечной точки /v1/embeddings. Это обновление позволяет отправлять запросы на создание мультимодальных эмбеддингов, принимая массивы контента в обёртке в стиле OpenAI, что даёт возможность совместно обрабатывать текстовые части и части image_url.
Liquid AI выпустила LFM2.5-VL-3B-DSpark — спекулятивный драфтер для ускорения декодирования до 3,13x
Liquid AI выпустила LFM2.5-VL-3B-DSpark, экспериментальную модель черновика для спекулятивного декодирования к своей зрительно-языковой модели LFM2.5-VL-3B. Драфтер добавляет около 280 млн параметров и ускоряет генерацию токенов без изменения распределения выходных данных модели.
Liquid AI выпустила LFM2.5-VL-DSpark для ускорения вывода модели зрения и языка
Liquid AI выпустила черновик модели LFM2.5-VL-DSpark, спекулятивный декодер (drafter), предназначенный для ускорения вывода модели зрения и языка LFM2.5-VL-3B. Drafer захватывает скрытые состояния из фиксированных слоёв целевой модели для генерации кандидатов токенов, добавляя лишь 280M параметров (накладные расходы 8,9%) при сохранении одинаковой размерности между модальностями.
Liquid AI выпустила черновую модель DSpark для LFM2.5-VL-3B
Liquid AI выпустила экспериментальную черновую модель DSpark для своей мультимодельной модели LFM2.5-VL-3B, обеспечивающую более быстрый декодирование на периферийных устройствах и GPU без изменения качества вывода.