Liquid AI ha liberado como código abierto los modelos de borrador DSpark para su serie LFM2.5, permitiendo la decodificación especulativa que ofrece una mejora de rendimiento de hasta 3,18x en GPUs y 2,87x en dispositivos.
- La arquitectura DSpark combina un núcleo paralelo, una cabeza secuencial ligera y un verificador con programación de confianza para reducir la latencia en la fase de decodificación limitada por memoria.
- Se proporciona soporte desde el primer día para llama.cpp y SGLang, permitiendo a los usuarios ejecutar los modelos con cambios mínimos en la configuración.
- En un MacBook Pro con M4 Max, LFM2.5-2.6B alcanza velocidades superiores a 140 tok/s, mientras que la latencia de llamada a funciones se reduce un 57% en promedio.
- Los puntos de control del modelo de borrador están disponibles en formatos Safetensors y GGUF para varios tamaños de LFM2.5, incluidos 1.2B, 2.6B y 8B.
La integración permite a los usuarios desplegar inferencia agencial eficiente localmente o en aceleradores sin sacrificar la precisión de la decodificación voraz.