O projeto llama.cpp lançou a versão b10684, que inclui uma correção específica para o backend SYCL para que a flag `--fit` respeite o `--fit-target` com mais precisão.

  • O algoritmo `--fit` agora leva em conta o VRAM de pico real necessário para um determinado tamanho de contexto nos backends SYCL.
  • Isso evita erros de falta de memória ao calcular corretamente o uso de VRAM quando o contexto alocado está totalmente utilizado.
  • Também interrompe cálculos excessivamente conservadores que anteriormente reservavam muito VRAM.
  • Testes em um Arc b70 com qwen3.8 do unsloth (Q4_K_XL) demonstraram um contexto utilizável de 262144 com KV e MTP em q8_0 usando `--fit-target 1`.

Esta alteração permite que os usuários utilizem contextos maiores em hardware SYCL sem ficar sem memória, evitando ao mesmo tempo o desperdício de VRAM reservado devido a estimativas conservadoras anteriores.