llama.cppプロジェクトはビルドb11039をリリースし、SWAを使用するすべてのモデルに対して、スライディングウィンドウアテンション(SWA)パターンとMLA SWAジオメトリを書き出すようにモデルセーバーを更新しました。この変更により、`sliding_window_pattern`がスカラーに圧縮されるのではなく、レイヤーごとのフラグとして書き出され、正確なデータ表現が保持されます。

  • ローダーは現在、`llama_model_base::load_swa_pattern()`を通じてSWAパターンを周期またはレイヤーごとの配列として読み取り、olmo2、gemma3n、exaone4のコンバーターにおける配列のサイレント無視を修正しました。
  • モデルセーバーは、SWAレイヤーに対してMLAキー/バリューの長さとKV LoRAランクを書き出します。これはdots3noteによって必要とされます。
  • これにより、plamo3、gemma3、cohere2、cohere2moe、olmo2、exone-moe、afmoe、mimo2、spark2_5、muse-glimmer、mellum、laguna、granite_swa、dots3note、mapleのセーバーが有効化されます。
  • 記載されたすべてのモデルはtest-llama-archsのビット完全なラウンドトリップテストに合格しています。

この更新により、llama.cppによって生成されるGGUFファイルが意図したSWA構成と一致し、デフォルト周期に依存していた既存のパブリッシュ済みファイルの出力は変更されません。