Liquid AI ha lanzado el modelo borrador LFM2.5-VL-DSpark, un generador de decodificación especulativa diseñado para acelerar la inferencia del modelo de visión y lenguaje LFM2.5-VL-3B. El generador captura estados ocultos de capas fijas del modelo objetivo para generar tokens candidatos, añadiendo solo 280M parámetros (un exceso del 8,9%) mientras mantiene una dimensionalidad idéntica entre modalidades.
- Las aceleraciones en la velocidad de decodificación alcanzan hasta 3,13x en dispositivos Apple M5 Max y 2,66x en GPUs NVIDIA H100.
- Las mejoras en latencia de extremo a extremo oscilan entre 1,56x y 2,62x en dispositivo y entre 1,64x y 2,27x en GPU.
- El modelo proporciona soporte de integración desde el primer día para llama.cpp, MLX-VLM y SGLang.
- La decodificación especulativa acelera únicamente la fase de decodificación; el prellenado y la codificación visual siguen siendo cuellos de botella limitados por la computación en dispositivos periféricos.
El lanzamiento permite un despliegue más rápido de modelos de visión y lenguaje de peso abierto en diversos entornos de hardware sin restringir el ajuste fino o la distribución.