llama.cpp b11372リリースは、qwen4expモデルのライトニングインデクサーの最適化を導入し、主に長期コンテキスト処理中のインデクサースコアに必要なメモリを半減させます。これは、各ヘッドのために個別のテンソルを生成するのではなく、ヘッドスコアをその場で計算することで実現されます。

  • qwen4expインデクサーはアロケーターバッファを再利用し、ggml_lightning_indexer経由でスコアを計算してピークメモリ使用量を削減します。
  • 4ヘッドのライトニングインデクサーに対するCUDAバックエンドサポートが追加され、ベクターカーネルにディスパッチされます。
  • Metalバックエンドは関数定数からヘッド数を取得するように更新され、コード変更なしで任意のヘッド数を実行可能になりました。
  • Vulkanバックエンドは共有メモリとfp16ドット積を使用して、ライトニングインデクサーをキーとトークンにタイル化します。

これらの変更により、qwen4expモデルの長期コンテキストにおけるメモリ効率性が向上し、計算バッファサイズと速度は維持されます。