Liquid AIは、LFM2.5シリーズのDSparkドラフトモデルをオープンソース化し、GPUで最大3.18倍のスループット向上、デバイスでは2.87倍の向上をもたらすスペキュラティブ・デコーディングを可能にした。

  • DSparkアーキテクチャは、並列バックボーン、軽量シーケンシャルヘッド、信頼度スケジュール付き検証子を組み合わせ、メモリバウンドなデコードフェーズのレイテンシを削減する。
  • llama.cppとSGLangに対して当日サポートを提供し、最小限の設定変更でモデルを実行可能にする。
  • M4 Max MacBook Proでは、LFM2.5-2.6Bが140 tok/sを超える速度を達成し、関数呼び出しのレイテンシは平均57%削減された。
  • ドラフトモデルのチェックポイントは、SafetensorsとGGUF形式で提供され、1.2B、2.6B、8Bなど各種LFM2.5サイズに対応している。

この統合により、ユーザーは貪欲デコーディングの精度を犠牲にすることなく、ローカルまたはアクセラレータ上で効率的なエージェント推論を展開できる。