Liquid AIは、LFM2.5-VL-3Bビジョン言語モデルの推論を加速するために設計されたスペキュラティブデコーディング用ドラフターであるLFM2.5-VL-DSparkドラフトモデルをリリースした。このドラフターは、ターゲットモデルの固定レイヤーから隠れ状態を取得して候補トークンを生成し、モダリティ間で次元数を同一に保ちながら、パラメータ数を280M(オーバーヘッド8.9%)のみ追加する。
- Apple M5 Maxデバイスではデコーディング速度が最大3.13倍、NVIDIA H100 GPUでは2.66倍の高速化を実現。
- デバイス上でのエンドツーエンドレイテンシ改善は1.56倍から2.62倍、GPU上では1.64倍から2.27倍の範囲。
- llama.cpp、MLX-VLM、SGLangに対してday-one統合サポートを提供。
- スペキュラティブデコーディングはデコードフェーズのみを加速し、プリフィルとビジョンエンコーディングはエッジデバイスにおいて計算ボトルネックのまま。
このリリースにより、ファインチューニングや配布を制限することなく、多様なハードウェア環境でオープンウェイトのビジョン言語モデルのより迅速な展開が可能になる。