llama.cpp b10956 릴리스는 TOP_K 연산에서 큰 k 값을 처리하기 위해 SYCL 백엔드에 래디스 선택 알고리즘을 도입했으며, 이전에는 k > 32일 때 CPU로 폴백되었습니다. 이 변경은 히스토그램 기반 패스를 사용하여 공유 로컬 메모리 사용량을 k에 독립적으로 유지함으로써 큰 k의 GPU 상주 처리를 가능하게 합니다.
- 새로운 구현은 k 값을 2048 이상까지 지원하며, qwen4exp의 희소 어텐션 인덱서와 같은 연산에 대한 백엔드 왕복을 제거합니다.
- 성능 개선으로는 k=2048일 때 ne=[131072,1]에서 4.98배 속도 향상과 특정 배치 구성에서 CPU 폴백 대비 최대 118배 빠른 실행 속도가 포함됩니다.
- Qwen3.8-Flash-Next를 사용한 3x Arc Pro B60에서의 엔드투엔드 테스트는 d=131072에서 처리량이 5.91에서 6.05 t/s로 증가했으며, 퍼플렉시티는 변하지 않았음을 보여줍니다.
- 이 릴리스에는 CPU, CUDA, ROCm, Vulkan, OpenVINO 및 SYCL 백엔드를 위한 macOS, Linux, Windows, Android 및 openEuler용 바이너리가 포함되어 있습니다.
이 업데이트는 SYCL 장치에서 효율적인 큰-k top_k 연산을 가능하게 하여 토큰 선택에 높은 k 값이 필요한 모델의 성능 병목 현상을 방지합니다.