Liquid AI ha lanzado LFM2.5-VL-3B-DSpark, un modelo de borrador experimental de decodificación especulativa para su modelo de visión y lenguaje LFM2.5-VL-3B. El draftspeculativo añade aproximadamente 280M de parámetros y acelera la generación de tokens sin alterar la distribución de salida del modelo.

  • El draftspeculativo de 279,5M de parámetros utiliza una arquitectura simplificada solo de atención con 4 capas, aumentando el recuento total de parámetros desplegados en un 8,9%.
  • Las velocidades de decodificación alcanzan hasta 3,13x en silicio Apple M5 Max y 2,66x en GPUs NVIDIA H100, aunque las ganancias de extremo a extremo son menores debido a los tiempos fijos de codificación de imágenes.
  • Los pesos están disponibles en formatos Safetensors y GGUF con soporte desde el primer día para SGLang, MLX-VLM y llama.cpp bajo la Licencia Abierta LFM v1.0.
  • La salida permanece idéntica al modelo base bajo decodificación codiciosa, mientras que temperaturas más altas reducen las tasas de aceptación y el rendimiento.

El lanzamiento permite a los usuarios acelerar significativamente la inferencia en hardware compatible, con Liquid AI señalando que las fases de prellenado y codificación de visión permanecen sin acelerar.