Liquid AI a publié des points de contrôle de modèles brouillés pour sa famille LFM2.5 — spécifiquement LFM2.5-1.2B-Instruct, LFM2.5-2.6B et LFM2.5-8B-A1B — qui utilisent le décodage spéculatif pour améliorer considérablement la vitesse d'inférence sans compromettre la qualité de sortie.
- La méthode DSpark combine une colonne vertébrale parallèle, une tête séquentielle légère et un vérificateur à planification de confiance afin de réduire la latence en échangeant une mémoire minimale contre des gains importants de débit.
- Les benchmarks montrent une amélioration du débit jusqu'à 3,18x sur les GPU NVIDIA H100 et jusqu'à 2,87x sur les appareils edge comme le MacBook Pro M4 Max.
- Pour les charges de travail agentic impliquant l'appel de fonctions, DSpark réduit la latence en moyenne de 57 % sur l'ensemble de données BFCL.
- Les modèles brouillés sont open-sourcés en amont dans llama.cpp et SGLang, avec des points de contrôle disponibles sur Hugging Face aux formats Safetensors et GGUF.
Cette publication vise à rendre LFM2.5 viable pour les applications agentic sur appareil en fournissant un support dès le premier jour pour l'inférence edge efficace et le service GPU à haut débit.