llama.cpp 프로젝트는 양자화된 복사 커널 실행 시 SYCL 백엔드에 대한 중요한 수정을 포함하는 버전 b10456을 출시했습니다. 이 업데이트는 스레드 및 블록 수를 양자화 크기에 비례하도록 조정하여 과소 및 과다 구독 문제를 효과적으로 줄였습니다.
- 양자화된 cpy 커널 실행 시 스레드/블록 수 수정 (PR #27160).
- Arc 70에서 q4_0 -> f32 경로의 처리량이 20.21 GB/s에서 158.19 GB/s로 증가했습니다.
- 다른 양자화 경로에서도 일관된 성능 향상이 나타났습니다.
- CPU, CUDA, Vulkan, ROCm, OpenVINO 및 SYCL 백엔드를 통해 macOS, Linux, Windows, Android 및 openEuler용 바이너리가 제공됩니다.
이 변경은 SYCL 백엔스를 사용하는 Intel Arc GPU에서 데이터 전송 효율성을 크게 향상시켜 양자화된 연산의 주요 성능 병목 현상을 해결했습니다.