La version b11216 de llama.cpp introduit des noyaux Fast Walsh-Hadamard Transform (FWHT) dans le backend SYCL qui prennent en charge des largeurs de bloc supérieures à 512. Auparavant, les largeurs plus grandes basculaient vers un GEMM dense avec une complexité O(n^2) ; ce changement permet des performances O(n log n) pour ces tailles.
- La nouvelle implémentation `fwht_kernel_wide` exécute une ligne par groupe de travail et utilise la mémoire locale et les registres pour optimiser les opérations papillon.
- Elle prend en charge des largeurs de bloc de 1024, 2048, 4096 et 8192 via la construction de Kronecker/Paley.
- La version inclut des binaires pour macOS, Linux, Windows, Android et openEuler sur les backends CPU, GPU et NPU.
- La vérification a été effectuée à l'aide d'un harnais autonome sur un appareil SYCL CPU Intel oneAPI DPC++ 2026.1, confirmant l'exactitude par rapport à une implémentation de référence.
Cette mise à jour améliore l'efficacité computationnelle pour les grandes tailles de bloc dans les environnements SYCL tout en maintenant la compatibilité avec les configurations matérielles existantes.