Proyek llama.cpp merilis build b10076, yang memperkenalkan optimasi kinerja pada backend CUDA dengan memvektorkan operasi `get_rows` menggunakan salinan int4. Perubahan ini mengangkat pekerjaan invarian baris keluar dari loop per-elemen dan menambahkan jalur tervektorisasi yang menyalin 16 byte per thread untuk data kontigu tipe yang sama.

Implementasi ini digating pada waktu kompilasi dan runtime, memerlukan penjajaran 16 byte dan kondisi stride tertentu untuk memastikan kebenaran. Sebuah gate okupansi mencegah regresi pada pengumpulan baris tunggal kecil dengan menjaganya pada jalur skalar. Pada Strix Halo (gfx1151), optimasi ini mengurangi latensi pengumpulan keadaan rekuren DeltaNet dari 18,6us menjadi 13,0us.

Rilis ini mencakup biner untuk macOS, Linux, Windows, Android, dan openEuler melalui backend CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL, dan OpenCL.