Liquid AIは、そのLFM2.5-VL-3Bビジョン言語モデル用の実験的なスペキュラティブデコーディング用ドラフトモデルであるLFM2.5-VL-3B-DSparkをリリースした。このドラフターは約280Mのパラメータを追加し、モデルの出力分布を変更せずにトークン生成を加速する。
- 279.5Mパラメータのドラフターは4層の単純化されたアテンションのみアーキテクチャを使用し、展開される総パラメータ数を8.9%増加させる。
- Apple M5 Maxシリコンでは最大3.13倍、NVIDIA H100 GPUでは2.66倍のデコーディング速度を実現するが、固定された画像エンコーディング時間のためエンドツーエンドでの向上幅は小さくなる。
- 重みはSafetensorsおよびGGUF形式で提供され、LFM Open License v1.0の下でSGLang、MLX-VLM、llama.cppの当日サポートを含む。
- グリーディデコーディングでは出力がベースモデルと同一となる一方、高い温度設定は受容率とスループットを低下させる。
このリリースにより、ユーザーは互換性のあるハードウェア上で推論を大幅に高速化できる。Liquid AIによると、プリフィルおよびビジョンエンコーディングフェーズは加速されていない。