O projeto llama.cpp lançou a compilação b10076, que introduz uma otimização de desempenho no backend CUDA ao vetorizar a operação `get_rows` usando cópias int4. Essa mudança eleva o trabalho invariante à linha para fora do loop por elemento e adiciona um caminho vetorizado que copia 16 bytes por thread para dados contíguos do mesmo tipo.
A implementação é controlada em tempo de compilação e execução, exigindo alinhamento de 16 bytes e condições específicas de stride para garantir a correção. Um gate de ocupação evita regressão em coletas pequenas de uma única linha, mantendo-as no caminho escalar. No Strix Halo (gfx1151), essa otimização reduziu a latência de coleta do estado recorrente DeltaNet de 18.6us para 13.0us.
O lançamento inclui binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL e OpenCL.