El proyecto llama.cpp lanzó la compilación b10076, que introduce una optimización de rendimiento en el backend CUDA al vectorizar la operación `get_rows` utilizando copias int4. Este cambio eleva el trabajo invariante a la fila fuera del bucle por elemento y añade una ruta vectorizada que copia 16 bytes por hilo para datos contiguos del mismo tipo.
La implementación está condicionada en tiempo de compilación y ejecución, requiriendo alineación de 16 bytes y condiciones específicas de paso para garantizar la corrección. Un control de ocupación evita regresiones en recolecciones pequeñas de una sola fila manteniéndolas en la ruta escalar. En Strix Halo (gfx1151), esta optimización redujo la latencia de recolección del estado recurrente DeltaNet de 18.6us a 13.0us.
El lanzamiento incluye binarios para macOS, Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL y OpenCL.