Проект llama.cpp выпустил сборку b11043, которая включает изменение в реализации HMX flash-attention. Это обновление поддерживает размеры голов, не кратные 64, в частности позволяя конфигурации вроде SigLIP's head_dim=72.
- Ядро HMX flash-attention теперь работает с DK/DV, округленными до 64, с нулевыми заполненными хвостовыми полосами.
- Предварительно собранные бинарные файлы доступны для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android и openEuler.
Это изменение позволяет пользователям запускать модели с нестандартными размерами голов на поддерживаемом оборудовании без проблем совместимости.