Релиз llama.cpp b11463 включает обновление SYCL, которое включает поддержку MKL flash attention для специфичной формы Multi-Latent Attention (MLA) модели GLM-4.7 Flash, которая ранее отклонялась диспетчером.
- Изменение допускает форму 576/576/512 GQA-20 F16 в конвейер MKL и обрабатывает V cache как страйдированное представление строк K.
- Попытка сохранить оценки MKL flash attention в формате F16 для снижения трафика памяти была включена, но впоследствии отменена в этой сборке.
- На Intel Arc Pro B70 оптимизация MLA улучшила обработку промпта (pp8192) с 432.80 до 1292.29 tok/s, что составляет ускорение в 2.99 раза.
- Релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, ROCm, Vulkan, OpenVINO и SYCL.