Liquid AI выпустила черновик модели LFM2.5-VL-DSpark, спекулятивный декодер (drafter), предназначенный для ускорения вывода модели зрения и языка LFM2.5-VL-3B. Drafer захватывает скрытые состояния из фиксированных слоёв целевой модели для генерации кандидатов токенов, добавляя лишь 280M параметров (накладные расходы 8,9%) при сохранении одинаковой размерности между модальностями.

  • Ускорение декодирования достигает до 3,13x на устройствах Apple M5 Max и 2,66x на GPU NVIDIA H100.
  • Улучшение сквозной задержки составляет от 1,56x до 2,62x на устройстве и от 1,64x до 2,27x на GPU.
  • Модель обеспечивает поддержку интеграции с первого дня выпуска для llama.cpp, MLX-VLM и SGLang.
  • Спекулятивное декодирование ускоряет только фазу декодирования; префиллинг и кодирование зрения остаются узкими местами, ограниченными вычислительной мощностью, на периферийных устройствах.

Выпуск позволяет быстрее разворачивать модели зрения и языка с открытыми весами в различных аппаратных средах без ограничений на тонкую настройку или распространение.