Liquid AI a publié le modèle brouillon LFM2.5-VL-DSpark, un drafter de décodage spéculatif conçu pour accélérer l'inférence du modèle vision-langage LFM2.5-VL-3B. Le drafter capture les états cachés des couches fixes du modèle cible pour générer des tokens candidats, n'ajoutant que 280M de paramètres (surcharge de 8,9 %) tout en maintenant une dimensionalité identique entre les modalités.
- Les accélérations de décodage atteignent jusqu'à 3,13x sur les appareils Apple M5 Max et 2,66x sur les GPU NVIDIA H100.
- Les améliorations de latence de bout en bout varient de 1,56x à 2,62x sur l'appareil et de 1,64x à 2,27x sur le GPU.
- Le modèle fournit un support d'intégration dès le premier jour pour llama.cpp, MLX-VLM et SGLang.
- Le décodage spéculatif n'accélère que la phase de décodage ; le préremplissage et l'encodage visuel restent des goulets d'étranglement limités par le calcul sur les appareils edge.
Cette publication permet un déploiement plus rapide des modèles vision-langage à poids ouverts dans divers environnements matériels sans restreindre le fine-tuning ou la distribution.