llama.cpp プロジェクトはバージョン b10684 をリリースし、`--fit` フラグが `--fit-target` をより正確に尊重するようにする SYCL バックエンド用の特定の不具合修正が含まれています。
- `--fit` アルゴリズムは、SYCL バックエンドでの指定されたコンテキストサイズに必要な実際のピーク VRAM を考慮するようになりました。
- これにより、割り当てられたコンテキストが完全に使用されているときに VRAM 使用量を適切に計算することで、メモリ不足エラーを防ぎます。
- また、以前に過剰な VRAM を予約していた過度に保守的な計算も停止します。
- Arc b70 で unsloth の qwen3.8 (Q4_K_XL) を使用してテストした結果、`--fit-target 1` を使用して q8_0 KV および MTP で 262144 のコンテキストが利用可能であることを示しました。
この変更により、ユーザーは SYCL ハードウェアでメモリ不足にならずにより大きなコンテキストを利用できるようになり、以前の保守的な見積もりによる予約済み VRAM の無駄も回避できます。