llama.cpp b11413 릴리스는 양자화된 Key 및 Value 텐서를 지원하는 새로운 Vulkan 기반 희소 플래시 어텐션 구현을 도입합니다. 이 업데이트는 큰 컨텍스트 윈도우를 가진 디코딩 작업에는 비용이 너무 많이 드는 이전 컴팩션 방법의 성능 문제를 해결합니다.

  • 새로운 접근 방식은 행을 연속된 세그먼트로 분할하여 서브그룹 또는 스레드에서 처리하며, 오름차순 인덱스 목록을 유지하기 위해 결합된 로드(ballot counting)를 사용합니다.
  • macOS(Apple Silicon 및 Intel), Linux(CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows(CPU, Vulkan, CUDA, OpenVINO, SYCL, ROCm), Android 및 iOS용 사전 빌드된 바이너리가 제공됩니다.
  • 릴리스에는 llama.cpp UI와 보안 검증을 위한 attestations도 포함되어 있습니다.