llama.cpp b11216 릴리스는 512보다 큰 블록 폭을 지원하는 SYCL 백엔드에서 Fast Walsh-Hadamard Transform (FWHT) 커널을 도입했습니다. 이전에는 더 큰 폭이 O(n^2) 복잡도를 가진 밀집 GEMM으로 폴백되었습니다; 이 변경은 이러한 크기에 대해 O(n log n) 성능을 가능하게 합니다.
- 새로운 `fwht_kernel_wide` 구현은 각 워크 그룹당 한 행을 실행하며 버터플라이 연산을 최적화하기 위해 로컬 메모리와 레지스터를 사용합니다.
- Kronecker/Paley 구성을 통해 1024, 2048, 4096, 8192의 블록 폭을 지원합니다.
- 이 릴리스에는 CPU, GPU 및 NPU 백엔드 전반에 걸쳐 macOS, Linux, Windows, Android 및 openEuler용 바이너리가 포함되어 있습니다.
- 검증은 Intel oneAPI DPC++ 2026.1 SYCL CPU 장치에서 독립 실행형 하니스를 사용하여 수행되었으며, 참조 구현 대비 정확성이 확인되었습니다.
이 업데이트는 기존 하드웨어 구성과의 호환성을 유지하면서 SYCL 환경에서 큰 블록 크기의 계산 효율성을 개선합니다.