El proyecto llama.cpp lanzó la versión b10684, que incluye una corrección específica para el backend de SYCL para que la bandera `--fit` respete `--fit-target` con mayor precisión.

  • El algoritmo `--fit` ahora tiene en cuenta el VRAM pico real requerido para un tamaño de contexto dado en los backends de SYCL.
  • Esto previene errores de falta de memoria al calcular correctamente el uso de VRAM cuando el contexto asignado está completamente utilizado.
  • También detiene cálculos excesivamente conservadores que anteriormente reservaban demasiado VRAM.
  • Las pruebas en un Arc b70 con qwen3.8 de unsloth (Q4_K_XL) demostraron un contexto utilizable de 262144 con KV y MTP en q8_0 usando `--fit-target 1`.

Este cambio permite a los usuarios utilizar contextos más grandes en hardware SYCL sin quedarse sin memoria, evitando al mismo tiempo el desperdicio de VRAM reservado debido a estimaciones conservadoras anteriores.