O lançamento llama.cpp b11216 introduz kernels da Transformada Rápida de Walsh-Hadamard (FWHT) no backend SYCL que suportam larguras de bloco maiores que 512. Anteriormente, larguras maiores recuavam para uma GEMM densa com complexidade O(n^2); esta mudança permite desempenho O(n log n) para esses tamanhos.
- A nova implementação `fwht_kernel_wide` executa uma linha por work-group e usa memória local e registradores para otimizar as operações borboleta.
- Suporta larguras de bloco de 1024, 2048, 4096 e 8192 por meio da construção Kronecker/Paley.
- O lançamento inclui binários para macOS, Linux, Windows, Android e openEuler em backends de CPU, GPU e NPU.
- A verificação foi realizada usando um harness independente em um dispositivo SYCL de CPU Intel oneAPI DPC++ 2026.1, confirmando a correção contra uma implementação de referência.
Esta atualização melhora a eficiência computacional para tamanhos de bloco grandes em ambientes SYCL enquanto mantém a compatibilidade com configurações de hardware existentes.