Le projet llama.cpp a publié la compilation b10076, qui introduit une optimisation de performance dans le backend CUDA en vectorisant l'opération `get_rows` à l'aide de copies int4. Ce changement extrait le travail invariant par ligne de la boucle élément par élément et ajoute un chemin vectorisé qui copie 16 octets par thread pour des données contiguës du même type.
L'implémentation est conditionnée au moment de la compilation et de l'exécution, nécessitant un alignement de 16 octets et des conditions de stride spécifiques pour garantir l'exactitude. Un gate d'occupation empêche la régression sur les petits gather à une seule ligne en les maintenant sur le chemin scalaire. Sur Strix Halo (gfx1151), cette optimisation a réduit la latence du gather d'état récurent DeltaNet de 18,6 us à 13,0 us.
La version inclut des binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL et OpenCL.