Liquid AIは、視覚言語モデル LFM2.5-VL-3B のための実験的な DSpark ドラフトモデルをリリースし、出力品質を変更せずにエッジデバイスやGPUでより高速なデコードを可能にしました。

ドラフターは展開されたモデルのパラメータ数に約8.9%を追加し、H100 GPU で最大 2.66倍、Apple Silicon エッジデバイスで 3.13倍のデコードスループット改善を実現します。

エンドツーエンドのスループット向上は GPU で 2.27倍、エッジハードウェアで 2.62倍に達し、システムは SGLang 内のさまざまな同時実行レベル全体でスループットの優位性を維持しています。

著者らは、推論デコードがデコードフェーズのみを加速することを指摘しており、視覚エンコーディングとプリフィルのコストは変更されないため、リソース制約のあるエッジデバイスにおける全体的なレイテンシ改善が制限されると述べています。