La versión llama.cpp b10256 incluye un cambio para paralelizar el kernel de concatenación no contigua para dispositivos SYCL. La actualización modifica la geometría de lanzamiento desde un grupo de trabajo de un solo carril a uno que utiliza `SYCL_CONCAT_BLOCK_SIZE`.
- El kernel de concatenación no contigua de SYCL ahora lanza un grupo de trabajo más ancho para mejorar el paralelismo.
- Las pruebas en un Arc Pro B70 con Qwen3.6-27B muestran un aumento del 9,4% en el rendimiento (de 920 a 1006 t/s).
- La versión proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, Vulkan, ROCm, OpenVINO y SYCL.
Esta optimización mejora el rendimiento de inferencia en GPUs de Intel utilizando el backend SYCL.