llama.cpp プロジェクトはバージョン b10718 をリリースし、CUDA バックエンドの重要なアップデートが含まれています。最も注目すべき変更は、Mixture of Experts (MOE) 融合をスペキュレイティブデコーディング(specdec)のサポートに拡張し、以前 MOE glu 融合と topk-router 融合が一度に1つのトークンの処理のみ制限されていたという制限に対処したことです。

  • CUDA: specdec 向けに MOE 融合を拡張し、以前の MOE glu および topk-router 融合の単一トークン制限を解除しました。
  • マルチトークン MOE 融合実装に SWIGLU_CLAMP ケースのサポートを追加しました。
  • プルリクエスト #27621 のレビューコメントに対応しました。

このアップデートにより、NVIDIA GPU でより効率的な融合操作が有効化され、スペキュレイティブデコーディングを使用するモデルのパフォーマンスが向上します。