llama.cpp 프로젝트는 HMX flash-attention 구현에 변경 사항을 포함하는 빌드 b11043을 출시했습니다. 이 업데이트는 64의 배수가 아닌 헤드 차원을 지원하도록 활성화하며, 특히 SigLIP의 head_dim=72와 같은 구성을 허용합니다.
- HMX flash-attention 커널은 이제 DK/DV를 64로 올림하고 제로 채워진 테일 레인에서 작동합니다.
- macOS (Apple Silicon 및 Intel), iOS, Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android 및 openEuler에 대한 사전 빌드된 바이너리가 제공됩니다.
이 변경으로 사용자는 호환성 문제 없이 지원되는 하드웨어에서 비표준 헤드 차원을 가진 모델을 실행할 수 있습니다.