El proyecto llama.cpp lanzó la compilación b10781, que incluye una corrección para la ruta de desquantización de atención rápida (FA) de Vulkan. La actualización aborda un problema en el que el shader verificaba incorrectamente `nb[3]` incluso cuando `ne[3] == 1`, lo que provocaba que la ruta solo se activara cuando la caché estaba llena.
- Omite la verificación de `nb[3]` cuando `ne[3] == 1` porque el shader nunca lo lee para un único flujo.
- Resuelve un error lógico donde las vistas de la caché transportaban la línea completa del búfer, reduciendo la verificación anterior a `n_kv == kv_size`.
- Proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) y openEuler.
Esta corrección asegura que la ruta de desquantización de FA de Vulkan se active correctamente durante la inferencia en lugar de estar restringida a estados de caché completa.