llama.cpp 프로젝트는 Qwen4 모델에 대해 희소 Flash Attention (FA) 지원을 활성화하는 풀 리퀘스트를 포함하는 버전 b11062를 출시했습니다.
이 업데이트는 더 광범위한 b11062 릴리스의 일부로, CPU, GPU(CUDA, ROCm, Vulkan), AI 가속기 백엔드용 macOS, Linux, Windows, Android 및 openEuler용 바이너리를 제공합니다.
릴리스 노트에 언급된 특정 변경 사항은 효율성을 개선하기 위해 Qwen4에 희소 FA 기능을 추가합니다.