llama.cpp 프로젝트는 Flash Attention (FA) Vulkan 백엔드에 대한 iq4_nl 양자화 지원을 복원하는 빌드 b10165을 출시했습니다. 이 변경은 공유 메모리 사용량에 대한 우려가 무시할 수 있는 수준으로 간주된 후 기능을 다시 활성화하여 이슈 #23681을 해결합니다.
- Vulkan FA 구현에 iq4_nl 지원을 다시 추가합니다.
- non-coopmat2 구성에 q1_0 지원을 추가합니다.
- q1_0 FA 지원 제거와 관련된 GitHub 이슈 #23681을 수정합니다.
이 릴리스는 CPU, CUDA, ROCm, OpenVINO, SYCL 및 Vulkan 백엔드를 위한 macOS, Linux, Windows 및 Android용 바이너리를 제공합니다.