Rilis llama.cpp b11216 memperkenalkan kernel Transformasi Walsh-Hadamard Cepat (FWHT) di backend SYCL yang mendukung lebar blok lebih besar dari 512. Sebelumnya, lebar yang lebih besar jatuh kembali ke GEMM padat dengan kompleksitas O(n^2); perubahan ini memungkinkan kinerja O(n log n) untuk ukuran tersebut.

  • Implementasi `fwht_kernel_wide` baru menjalankan satu baris per work-group dan menggunakan memori lokal serta register untuk mengoptimalkan operasi kupu-kupu.
  • Mendukung lebar blok 1024, 2048, 4096, dan 8192 melalui konstruksi Kronecker/Paley.
  • Rilis ini mencakup biner untuk macOS, Linux, Windows, Android, dan openEuler di seluruh backend CPU, GPU, dan NPU.
  • Verifikasi dilakukan menggunakan harness mandiri pada perangkat CPU SYCL Intel oneAPI DPC++ 2026.1, mengonfirmasi kebenaran terhadap implementasi referensi.

Pembaruan ini meningkatkan efisiensi komputasi untuk ukuran blok besar di lingkungan SYCL sambil mempertahankan kompatibilitas dengan konfigurasi perangkat keras yang ada.