Liquid AIは、そのLFM2.5ファミリーの3つのモデル向けに、DSparkドラフトモデルのチェックポイントをリリースした。対象となるのはLFM2.5-1.2B-Instruct、LFM2.5-2.6B、およびLFM2.5-8B-A1Bである。

これらのドラフターは既存のターゲットモデルに推測的デコーディングのパスを追加し、約300Mパラメータのドラフトが9つの候補トークンのブロックを提案し、ターゲットモデルが単一の順伝播で検証する仕組みとなっている。

  • H100上では最大3.18倍の高速デコーディングを実現し、変更なしでモデル出力を保証する。また、M4 Max MacBook Proでは最大2.87倍の高速化を達成している。
  • グリーディデコーディング下では、生成されるシーケンスはターゲットモデル単独で実行した場合と同一であり、ベンチマーク精度が不変に保たれることを保証する。
  • DFlashスタイルの並列バックボーンと、マルコフ連鎖としてモデル化された軽量な逐次ヘッド、さらに信頼度スケジュール付きの検証器を組み合わせている。
  • 複数ツール関数呼び出しシナリオではLFM2.5-2.6Bで平均57%のレイテンシー削減を実現したが、Apple silicon上ではMoEモデルは現在の実装制限により1.18倍の高速化にとどまる。
  • ウェイトはSafetensorsおよびGGUF形式で提供され、llama.cppとSGLangにおいて同日サポートが開始されている。

この技術により、開発者はローカルコードアシスタント、オンデバイスエージェント、オフラインコパイロットの推論レイテンシーを大幅に削減しつつ、セルフホスティングを通じてデータプライバシーを維持できる。