Компания Liquid AI выпустила контрольные точки черновых моделей для семейства LFM2.5 — в частности, LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B — которые используют спекулятивное декодирование для значительного улучшения скорости вывода без ущерба качеству результата.
- Метод DSpark объединяет параллельное ядро, легковесную последовательную голову и верификатор с планированием уверенности, чтобы снизить задержку, жертвуя минимальным объемом памяти ради большого прироста пропускной способности.
- Тесты показывают улучшение пропускной способности до 3.18x на графических процессорах NVIDIA H100 и до 2.87x на мобильных устройствах, таких как MacBook Pro с чипом M4 Max.
- Для агентных рабочих нагрузок, включающих вызов функций, DSpark снижает задержку в среднем на 57% по набору данных BFCL.
- Черновые модели открыты в репозиториях llama.cpp и SGLang, а контрольные точки доступны на Hugging Face в форматах Safetensors и GGUF.
Этот релиз направлен на то, чтобы сделать LFM2.5 пригодной для агентных приложений на устройстве, обеспечивая поддержку эффективного вывода на мобильных устройствах и обслуживания с высокой пропускной способностью на GPU с первого дня.