Релиз llama.cpp b11216 вводит ядра быстрого преобразования Уолша-Адамара (FWHT) в бэкенде SYCL, которые поддерживают ширины блоков более 512. Ранее для больших ширин происходил переход к плотному GEMM со сложностью O(n^2); это изменение обеспечивает производительность O(n log n) для таких размеров.
- Новая реализация `fwht_kernel_wide` выполняет одну строку на рабочую группу и использует локальную память и регистры для оптимизации бабочковых операций.
- Поддерживаются ширины блоков 1024, 2048, 4096 и 8192 с помощью конструкции Кронекера/Палея.
- Релиз включает бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, GPU и NPU.
- Проверка была выполнена с использованием автономного инструмента на устройстве SYCL CPU Intel oneAPI DPC++ 2026.1, подтвердив корректность по сравнению с эталонной реализацией.
Это обновление повышает вычислительную эффективность для больших размеров блоков в средах SYCL, сохраняя совместимость с существующими конфигурациями оборудования.