Liquid AI открыла исходный код черновых моделей DSpark для серии LFM2.5, что позволяет использовать спекулятивное декодирование и обеспечивает увеличение пропускной способности до 3,18 раза на GPU и в 2,87 раза на устройствах.

  • Архитектура DSpark объединяет параллельное ядро, легковесную последовательную голову и верификатор с планированием уверенности для снижения задержек на этапе декодирования, ограниченного памятью.
  • Поддержка llama.cpp и SGLang предоставляется сразу при выпуске, что позволяет пользователям запускать модели с минимальными изменениями конфигурации.
  • На MacBook Pro с чипом M4 Max модель LFM2.5-2.6B достигает скорости более 140 tok/s, а средняя задержка вызова функций снижается на 57%.

Черновые контрольные точки доступны в форматах Safetensors и GGUF для различных размеров LFM2.5, включая 1.2B, 2.6B и 8B.

Интеграция позволяет пользователям разворачивать эффективный агентный инференс локально или на ускорителях без потери точности жадного декодирования.