El proyecto llama.cpp lanzó la versión b10456, que incluye una corrección crítica para el backend SYCL en los lanzamientos del kernel de copia cuantizada. La actualización ajusta los recuentos de hilos y bloques para que sean proporcionales al tamaño de la cuantización, reduciendo efectivamente los problemas de subasignación y sobreasignación.
- Corrige el recuento de hilos/bloques en los lanzamientos del kernel cpy cuantizado (PR #27160).
- El rendimiento para la ruta q4_0 -> f32 en un Arc 70 aumenta de 20.21 GB/s a 158.19 GB/s.
- Otras rutas de cuantización muestran aumentos planos de rendimiento.
- Los binarios están disponibles para macOS, Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, Vulkan, ROCm, OpenVINO y SYCL.
Este cambio mejora significativamente la eficiencia de la transferencia de datos en las GPUs Intel Arc que utilizan el backend SYCL, abordando un cuello de botella importante en las operaciones cuantizadas.