El proyecto llama.cpp lanzó la versión b10723, que incluye optimizaciones específicas para OpenCL en hardware gráfico Intel Xe-LP. La actualización se centra en mejorar el rendimiento de generación de tensores (TG) y prellenado (PP) ajustando los núcleos de cuantización.
- Se ajustaron las operaciones mul_mv Q4_K y Q5_K para aumentar los valores N_DST, permitiendo una reutilización 2x de activaciones en dispositivos Intel.
- Se implementaron configuraciones de bloques 8x8 tanto para las operaciones mul_mm Q4_K como Q5_K específicamente para arquitecturas Intel.
- Se aumentó N_DST de 8 a 16 para mul_mv Q4_K para optimizar aún más el manejo de datos.
Esta versión proporciona binarios actualizados para macOS, Linux, Windows, Android e iOS en varios backends incluyendo CUDA, Vulkan, ROCm y SYCL.