Liquid AI ha lanzado puntos de control de modelos borrador para su familia LFM2.5, específicamente LFM2.5-1.2B-Instruct, LFM2.5-2.6B y LFM2.5-8B-A1B, que utilizan descodificación especulativa para mejorar significativamente la velocidad de inferencia sin comprometer la calidad de salida.

  • El método DSpark combina una columna vertebral paralela, una cabeza secuencial ligera y un verificador con programación de confianza para reducir la latencia intercambiando memoria mínima por grandes ganancias en el rendimiento.
  • Los benchmarks muestran hasta 3.18x mejora en el rendimiento en GPUs NVIDIA H100 y hasta 2.87x en dispositivos edge como el MacBook Pro M4 Max.
  • Para cargas de trabajo agénticas que implican llamada a funciones, DSpark reduce la latencia en un promedio del 57% en el conjunto de datos BFCL.
  • Los modelos borrador se han liberado como código abierto upstream en llama.cpp y SGLang, con puntos de control disponibles en Hugging Face tanto en formatos Safetensors como GGUF.

Este lanzamiento tiene como objetivo hacer viable LFM2.5 para aplicaciones agénticas en dispositivo proporcionando soporte desde el primer día para inferencia edge eficiente y servicio GPU de alto rendimiento.