llama.cpp 프로젝트는 빌드 b10871을 출시하여 Vulkan의 dmmv 경로에 전용 mul_mat_vec_iq4_xs 셰이더를 도입했습니다. 이 변경은 RDNA4 하드웨어에서 성능을 향상시키기 위해 이전의 일반적인 폴백 구현을 대체합니다.

  • 새로운 셰이더는 사용하는 모델에 따라 약 6-17% 더 빠른 토큰 생성을 제공합니다.
  • n_it <= 8에 대한 블록 루프를 완전히 풀기 시도한 실험적 브랜치는 코드에 유지된 단순 루프와 기능적으로 동일하므로 제거되었습니다.
  • 바이너리는 CPU, CUDA, ROCm, OpenVINO, SYCL 및 Vulkan 백엔드에 대해 macOS, Linux, Windows, Android 및 openEuler에서 사용할 수 있습니다.