Liquid AI a publié un modèle brouillon expérimental DSpark pour son modèle de vision-langage LFM2.5-VL-3B, permettant un décodage plus rapide sur les appareils edge et les GPU sans changer la qualité de sortie.

Le drafter ajoute environ 8,9% au nombre de paramètres du modèle déployé et atteint des améliorations de débit de décodage jusqu'à 2,66x sur les GPU H100 et 3,13x sur les appareils edge Apple Silicon.

Les gains de débit de bout en bout atteignent 2,27x sur les GPU et 2,62x sur le matériel edge, le système maintenant un avantage de débit à travers différents niveaux de concurrence dans SGLang.

Les auteurs notent que le décodage spéculatif n'accélère que la phase de décodage, ce qui signifie que les coûts d'encodage visuel et de préremplissage restent inchangés, limitant ainsi les améliorations globales de latence sur les appareils edge à ressources limitées.