Liquid AI ha lanzado puntos de control del modelo borrador DSpark para tres modelos de su familia LFM2.5: LFM2.5-1.2B-Instruct, LFM2.5-2.6B y LFM2.5-8B-A1B. Estos generadores de borrador añaden una ruta de decodificación especulativa a los modelos objetivo existentes, permitiendo que un borrador de aproximadamente 300M parámetros proponga un bloque de nueve tokens candidatos que el modelo objetivo verifica en un solo pase hacia adelante.

  • El sistema ofrece hasta 3,18 veces más velocidad de decodificación en una H100 y hasta 2,87 veces en un MacBook Pro M4 Max sin cambiar las salidas del modelo.
  • Bajo decodificación codiciosa (greedy), la secuencia emitida es idéntica a la del modelo objetivo ejecutado solo, asegurando que la precisión del benchmark permanezca inalterada.
  • DSpark combina una columna vertebral paralela estilo DFlash con una cabeza secuencial ligera modelada como una cadena de Markov y un verificador con programación de confianza.
  • En escenarios de llamada a funciones con múltiples herramientas, se observa una reducción promedio del 57% en la latencia para LFM2.5-2.6B, aunque los modelos MoE solo ganan 1,18x en silicona Apple debido a las limitaciones actuales de implementación.
  • Los pesos están disponibles como Safetensors y GGUF, con soporte desde el primer día en llama.cpp y SGLang.

La tecnología permite a los desarrolladores reducir significativamente la latencia de inferencia para asistentes de código locales, agentes en dispositivo y copilotos sin conexión, manteniendo la privacidad de los datos mediante el autoalojamiento.