Liquid AI ha lanzado un modelo borrador experimental DSpark para su modelo de lenguaje y visión LFM2.5-VL-3B, permitiendo una decodificación más rápida en dispositivos edge y GPUs sin cambiar la calidad de salida.
El drafter añade aproximadamente el 8,9% al conteo de parámetros del modelo desplegado y logra mejoras en el rendimiento de decodificación de hasta 2,66x en GPUs H100 y 3,13x en dispositivos edge con Apple Silicon.
Las ganancias de rendimiento de extremo a extremo alcanzan 2,27x en GPUs y 2,62x en hardware edge, manteniendo el sistema una ventaja de rendimiento a través de diferentes niveles de concurrencia en SGLang.
Los autores señalan que la decodificación especulativa solo acelera la fase de decodificación, lo que significa que los costos de codificación visual y prellenado permanecen sin cambios, lo que limita las mejoras generales de latencia en dispositivos edge con recursos limitados.