Liquid AI a open-sourcé les modèles de brouillon DSpark pour sa série LFM2.5, permettant le décodage spéculatif qui offre une amélioration du débit jusqu'à 3,18x sur les GPU et 2,87x sur les appareils.

  • L'architecture DSpark combine un squelette parallèle, une tête séquentielle légère et un vérificateur à planification de confiance pour réduire la latence dans la phase de décodage limitée par la mémoire.
  • Un support dès le premier jour est fourni pour llama.cpp et SGLang, permettant aux utilisateurs d'exécuter les modèles avec des modifications de configuration minimales.
  • Sur un MacBook Pro M4 Max, LFM2.5-2.6B atteint des vitesses dépassant 140 tok/s, tandis que la latence d'appel de fonction est réduite en moyenne de 57 %.
  • Les points de contrôle des modèles de brouillon sont disponibles au format Safetensors et GGUF pour différentes tailles de LFM2.5, notamment 1,2B, 2,6B et 8B.

L'intégration permet aux utilisateurs de déployer une inférence agente efficace localement ou sur des accélérateurs sans sacrifier la précision du décodage glouton.