llama.cpp 프로젝트는 버전 b10899를 출시하며 Vulkan 백엔드에 특정 성능 개선을 도입했습니다. 이 업데이트는 Qwen 모델 계열에 대한 행렬 연산 최적화와 작은 M 값에 대한 전반적인 성능 향상에 중점을 둡니다.
- Vulkan에서 A/B 행렬을 교환하여 m=1 mul_mat을 최적화합니다.
- 작은 M 차원에 대한 성능을 개선합니다.
- 작은 M 값에 대해 split_k 지원을 활성화합니다.
- coopmat2에 대한 작은 타일과 중간 타일 선택을 N뿐만 아니라 M에 의존하도록 조정합니다.
이러한 변경은 특히 지정된 행렬 최적화의 혜택을 받는 Qwen과 같은 모델에 대해 Vulkan 호환 하드웨어에서 추론 효율성을 향상시키는 것을 목표로 합니다.