Liquid AI выпустила экспериментальную черновую модель DSpark для своей мультимодельной модели LFM2.5-VL-3B, обеспечивающую более быстрый декодирование на периферийных устройствах и GPU без изменения качества вывода.
Драфтер увеличивает количество параметров развернутой модели примерно на 8,9% и достигает улучшения пропускной способности декодирования до 2,66x на GPU H100 и 3,13x на периферийных устройствах Apple Silicon.
Прирост сквозной пропускной способности достигает 2,27x на GPU и 2,62x на периферийном оборудовании, при этом система сохраняет преимущество по пропускной способности на различных уровнях параллелизма в SGLang.
Авторы отмечают, что спекулятивное декодирование ускоряет только фазу декодирования, что означает, что затраты на кодирование изображений и префиллинг остаются неизменными, что ограничивает общее улучшение задержки на периферийных устройствах с ограниченными ресурсами.