Liquid AI выпустила LFM2.5-VL-3B-DSpark, экспериментальную модель черновика для спекулятивного декодирования к своей зрительно-языковой модели LFM2.5-VL-3B. Драфтер добавляет около 280 млн параметров и ускоряет генерацию токенов без изменения распределения выходных данных модели.

  • Драфтер с 279,5 млн параметров использует упрощенную архитектуру только на основе внимания с 4 слоями, увеличивая общее количество развернутых параметров на 8,9%.
  • Скорость декодирования достигает до 3,13x на чипах Apple M5 Max и 2,66x на GPU NVIDIA H100, хотя конечные выигрыши ниже из-за фиксированного времени кодирования изображений.
  • Веса доступны в форматах Safetensors и GGUF с поддержкой SGLang, MLX-VLM и llama.cpp с первого дня под лицензией LFM Open License v1.0.
  • Выходные данные остаются идентичными базовой модели при жадном декодировании, тогда как более высокие температуры снижают частоту принятия и пропускную способность.

Выпуск позволяет пользователям значительно ускорить вывод на совместимом оборудовании, при этом Liquid AI отмечает, что фазы префилла и кодирования зрения остаются неускоренными.