La versión b11216 de llama.cpp introduce núcleos de Transformada Rápida de Walsh-Hadamard (FWHT) en el backend SYCL que admiten anchos de bloque mayores de 512. Anteriormente, los anchos más grandes recurrían a una GEMM densa con complejidad O(n^2); este cambio permite un rendimiento de O(n log n) para estos tamaños.
- La nueva implementación `fwht_kernel_wide` ejecuta una fila por grupo de trabajo y utiliza memoria local y registros para optimizar las operaciones mariposa.
- Admite anchos de bloque de 1024, 2048, 4096 y 8192 mediante la construcción de Kronecker/Paley.
- La versión incluye binarios para macOS, Linux, Windows, Android y openEuler en los backends de CPU, GPU y NPU.
- La verificación se realizó utilizando un arnés independiente en un dispositivo SYCL de CPU Intel oneAPI DPC++ 2026.1, confirmando la corrección frente a una implementación de referencia.
Esta actualización mejora la eficiencia computacional para tamaños de bloque grandes en entornos SYCL mientras mantiene la compatibilidad con las configuraciones de hardware existentes.