Liquid AI a publié LFM2.5-VL-3B-DSpark, un modèle d'ébauche expérimental de décodage spéculatif pour son modèle vision-langue LFM2.5-VL-3B. L'ébaucheur ajoute environ 280M de paramètres et accélère la génération de tokens sans modifier la distribution de sortie du modèle.

  • L'ébaucheur de 279,5M de paramètres utilise une architecture simplifiée basée uniquement sur l'attention avec 4 couches, augmentant le nombre total de paramètres déployés de 8,9 %.
  • Les vitesses de décodage atteignent jusqu'à 3,13x sur les puces Apple M5 Max et 2,66x sur les GPU NVIDIA H100, bien que les gains bout-en-bout soient inférieurs en raison des temps d'encodage d'image fixes.
  • Les poids sont disponibles au format Safetensors et GGUF avec un support dès le jour un pour SGLang, MLX-VLM et llama.cpp sous la licence LFM Open License v1.0.
  • La sortie reste identique à celle du modèle de base en décodage glouton, tandis que des températures plus élevées réduisent les taux d'acceptation et le débit.

Cette publication permet aux utilisateurs d'accélérer considérablement l'inférence sur un matériel compatible, Liquid AI notant que les phases de préremplissage et d'encodage visuel restent non accélérées.