O projeto llama.cpp lançou a versão b10684, que inclui uma correção específica para o backend SYCL para que a flag `--fit` respeite o `--fit-target` com mais precisão.
- O algoritmo `--fit` agora leva em conta o VRAM de pico real necessário para um determinado tamanho de contexto nos backends SYCL.
- Isso evita erros de falta de memória ao calcular corretamente o uso de VRAM quando o contexto alocado está totalmente utilizado.
- Também interrompe cálculos excessivamente conservadores que anteriormente reservavam muito VRAM.
- Testes em um Arc b70 com qwen3.8 do unsloth (Q4_K_XL) demonstraram um contexto utilizável de 262144 com KV e MTP em q8_0 usando `--fit-target 1`.
Esta alteração permite que os usuários utilizem contextos maiores em hardware SYCL sem ficar sem memória, evitando ao mesmo tempo o desperdício de VRAM reservado devido a estimativas conservadoras anteriores.