llama.cpp 프로젝트는 Vulkan 백엔드를 통해 스파스 Flash Attention에 대한 지원을 도입한 빌드 b10982를 출시했습니다. 이 업데이트는 특히 DSV4 및 GLM 모델을 대상으로 하며, 호환되는 GPU 하드웨어에서 스파스 주의 메커니즘을 활용할 수 있도록 합니다.
- Vulkan 구현에서 DSV4/GLM에 대한 스파스 Flash Attention 지원을 추가합니다.
- 튜닝된 구현 로직과 추가된 테스트를 포함합니다.
- 비결정적 atomicAdd 동작을 수정합니다.
- 디코드 벡터에 대한 cm2 디코드 벡터 지원 및 f16vec4 바인딩을 추가합니다.
- 로직을 단순화하고 변수 이름의 일관성을 개선합니다.
이 릴리스는 CPU, CUDA, ROCm, OpenVINO, SYCL 및 Vulkan 백엔드에 대해 macOS, Linux, Windows, Android 및 openEuler용 사전 컴파일된 바이너리를 제공합니다.