AdaSparkは、事前プロファイリングやキャリブレーションなしに推論中に検証幅と受容確率を学習する、DSparkのようなブロックドラフターのスケジューラーです。これは、コンテキストと候補の受容度を関数として検証時間をターゲットの結果に適合させ、ドラフト生成された候補とテキスト由来の候補が単一のベストファースト順序で競合できるようにします。

  • 3つの密なターゲットと1つのMixture-of-Expertsターゲットを持つ6つの公開データセットにおいて、AdaSparkは同じドラフラーを使用してllama.cppのDSparkより1.5〜3.1倍高速にデコードします。
  • AdaSparkを搭載したimparoエンジンは、デフォルトの3トークンチェーンで実行する場合と比較して1.17〜1.52倍高速であり、この向上はスケジューラーのみによるものです。
  • 幅スイープなしでも、密なターゲットでは最適な固定木幅に対して0.3%以内のパフォーマンスを維持し、Mixture-of-Expertsモデルでは最適な固定幅と同等のパフォーマンスを示します。

このアプローチは、オフラインキャリブレーションやスイープの必要性を排除しつつ、標準的なスケジューリング手法と比較して大幅な高速化を提供します。