Liquid AI выпустила контрольные точки черновой модели DSpark для трех моделей из семейства LFM2.5: LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B. Эти генераторы предложений добавляют путь спекулятивного декодирования к существующим целевым моделям, позволяя черновой модели с примерно 300 млн параметров предложить блок из девяти кандидатов на токены, которые целевая модель проверяет за один прямой проход.
- Система обеспечивает ускорение декодирования до 3,18x на H100 и до 2,87x на MacBook Pro M4 Max без изменения выходных данных модели.
- При жадном декодировании сгенерированная последовательность идентична результату работы целевой модели в одиночку, что гарантирует неизменность точности бенчмарков.
- DSpark объединяет параллельное ядро в стиле DFlash с легким последовательным блоком, смоделированным как цепь Маркова, и верификатором с расписанием уверенности.
- В сценариях вызова функций через несколько инструментов наблюдается среднее снижение задержки на 57% для LFM2.5-2.6B, хотя модели MoE получают ускорение всего в 1,18x на чипах Apple silicon из-за текущих ограничений реализации.
- Веса доступны в форматах Safetensors и GGUF, с поддержкой с первого дня выпуска в llama.cpp и SGLang.
Технология позволяет разработчикам значительно снизить задержку вывода для локальных помощников по программированию, агентных систем на устройстве и офлайн-копилотов, сохраняя конфиденциальность данных за счет самостоятельного хостинга.