llama.cpp 프로젝트는 metal 백엔드에 주요 최적화를 도입한 버전 b10538을 출시했습니다. 이 업데이트는 대규모 배치 크기에 대해서만 키-값(KV) 캐시의 디쿼ン타이제이션을 활성화합니다.
- 주요 변경 사항은 metal 백엔드이며, 이제 대규모 배치를 처리할 때만 디쿼안타이즈된 KV 캐싱을 적용합니다.
- macOS (Apple Silicon 및 Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) 및 openEuler용 바이너리가 제공됩니다.
- 이 릴리스에서는 macOS Apple Silicon의 KleidiAI 지원과 Ubuntu의 ROCm 7.14가 비활성화되었습니다.
이 최적화는 호환되는 하드웨어에서 대규모 배치 크기가 포함된 워크로드에 대한 메모리 효율성 또는 성능을 개선하는 것을 목표로 합니다.