Liquid AIは、出力品質を損なうことなく推論速度を大幅に向上させるためにスペキュラティブ・デコーディングを活用する、そのLFM2.5ファミリーのドラフトモデルチェックポイント—具体的にはLFM2.5-1.2B-Instruct、LFM2.5-2.6B、およびLFM2.5-8B-A1B—をリリースした。
- DSpark手法は、並列バックボーン、軽量シーケンシャルヘッド、信頼度スケジュール付き検証子を組み合わせ、最小限のメモリ消費と引き換えに大きなスループット向上を実現し、レイテンシを削減する。
- ベンチマークでは、NVIDIA H100 GPUで最大3.18倍のスループット改善、M4 Max MacBook Proのようなエッジデバイスで最大2.87倍の改善を示している。
- 関数呼び出しを含むエージェントワークロードにおいて、DSparkはBFCLデータセット上で平均57%のレイテンシ削減を実現する。
- ドラフトモデルはllama.cppおよびSGLangでアップストリームにオープンソース化され、チェックポイントはHugging FaceでSafetensors形式とGGUF形式の両方で利用可能。
このリリースは、効率的なエッジ推論と高スループットGPUサービングの日次サポートを提供することで、デバイス上でのエージェントアプリケーションにおけるLFM2.5の実用化を目指している。