Liquid AI открыла исходный код черновых моделей DSpark для серии LFM2.5, что позволяет использовать спекулятивное декодирование и обеспечивает увеличение пропускной способности до 3,18 раза на GPU и в 2,87 раза на устройствах.
- Архитектура DSpark объединяет параллельное ядро, легковесную последовательную голову и верификатор с планированием уверенности для снижения задержек на этапе декодирования, ограниченного памятью.
- Поддержка llama.cpp и SGLang предоставляется сразу при выпуске, что позволяет пользователям запускать модели с минимальными изменениями конфигурации.
- На MacBook Pro с чипом M4 Max модель LFM2.5-2.6B достигает скорости более 140 tok/s, а средняя задержка вызова функций снижается на 57%.
Черновые контрольные точки доступны в форматах Safetensors и GGUF для различных размеров LFM2.5, включая 1.2B, 2.6B и 8B.
Интеграция позволяет пользователям разворачивать эффективный агентный инференс локально или на ускорителях без потери точности жадного декодирования.