llama.cpp 프로젝트는 CUDA 백엔드의 `get_rows` 작업을 int4 복사를 사용하여 벡터화하는 성능 최적화를 도입한 빌드 b10076을 출시했습니다. 이 변경은 요소별 루프에서 행 불변 작업을 끌어내고, 연속된 동일 타입 데이터에 대해 스레드당 16바이트를 복사하는 벡터화된 경로를 추가합니다.
구현은 컴파일 타임과 런타임에서 게이트되며, 정확성을 보장하기 위해 16바이트 정렬과 특정 스트라이드 조건이 필요합니다. 점유 게이트는 작은 단일 행 수집을 스칼라 경로에 유지하여 회귀를 방지합니다. Strix Halo (gfx1151) 에서 이 최적화는 DeltaNet 순환 상태 수집 지연 시간을 18.6us에서 13.0us로 줄였습니다.
이 릴리스에는 CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL 및 OpenCL 백엔드를 위한 macOS, Linux, Windows, Android 및 openEuler용 바이너리가 포함되어 있습니다.