llama.cpp 项目发布了版本 b10684,其中包含针对 SYCL 后端的特定修复,使 `--fit` 标志能更准确地尊重 `--fit-target`。
- `--fit` 算法现在会考虑在 SYCL 后端上给定上下文大小所需的实际峰值 VRAM。
- 当分配的上下文被完全使用时,通过正确计算 VRAM 使用量来防止内存不足错误。
- 它还停止了之前保留过多 VRAM 的过度保守计算。
- 在 Arc b70 上使用 unsloth 的 qwen3.8 (Q4_K_XL) 进行测试,展示了使用 `--fit-target 1` 时,q8_0 KV 和 MTP 可实现 262144 的可用上下文。
此更改允许用户在 SYCL 硬件上使用更大的上下文而不会内存不足,同时避免由于之前保守估计而浪费已保留的 VRAM。