Liquid AI telah merilis model draf LFM2.5-VL-DSpark, sebuah drafter decoding spekulatif yang dirancang untuk mempercepat inferensi bagi model visi-bahasa LFM2.5-VL-3B. Drafter ini menangkap keadaan tersembunyi dari lapisan tetap pada model target untuk menghasilkan token kandidat, hanya menambahkan 280M parameter (overhead 8,9%) sambil mempertahankan dimensi yang identik di seluruh modalitas.

  • Peningkatan kecepatan decoding mencapai hingga 3,13x pada perangkat Apple M5 Max dan 2,66x pada GPU NVIDIA H100.
  • Peningkatan latensi end-to-end berkisar dari 1,56x hingga 2,62x di perangkat dan 1,64x hingga 2,27x pada GPU.
  • Model ini menyediakan dukungan integrasi day-one untuk llama.cpp, MLX-VLM, dan SGLang.
  • Decoding spekulatif hanya mempercepat fase decode; prefill dan encoding visi tetap menjadi bottleneck yang dibatasi komputasi pada perangkat tepi.

Rilis ini memungkinkan penyebaran lebih cepat dari model visi-bahasa berbobot terbuka di berbagai lingkungan perangkat keras tanpa membatasi fine-tuning atau distribusi.