Liquid AIは、LFM2.5シリーズのDSparkドラフトモデルをオープンソース化し、GPUで最大3.18倍のスループット向上、デバイスでは2.87倍の向上をもたらすスペキュラティブ・デコーディングを可能にした。
- DSparkアーキテクチャは、並列バックボーン、軽量シーケンシャルヘッド、信頼度スケジュール付き検証子を組み合わせ、メモリバウンドなデコードフェーズのレイテンシを削減する。
- llama.cppとSGLangに対して当日サポートを提供し、最小限の設定変更でモデルを実行可能にする。
- M4 Max MacBook Proでは、LFM2.5-2.6Bが140 tok/sを超える速度を達成し、関数呼び出しのレイテンシは平均57%削減された。
- ドラフトモデルのチェックポイントは、SafetensorsとGGUF形式で提供され、1.2B、2.6B、8Bなど各種LFM2.5サイズに対応している。
この統合により、ユーザーは貪欲デコーディングの精度を犠牲にすることなく、ローカルまたはアクセラレータ上で効率的なエージェント推論を展開できる。