llama.cpp 프로젝트는 F16 키-값 (KV) 저장을 지원하는 새로운 텐서 API 플래시 어텐션 커널을 도입한 빌드 b11362를 출시했습니다. 이 업데이트는 CUDA, Vulkan 및 ROCm을 포함한 다양한 백엔드 옵션과 함께 macOS, Linux, Windows, Android 및 iOS 플랫폼에서 사용할 수 있습니다.

  • 특정 차원에 대한 텐서 FA 커널 추가: DK=DV=512, DK=576/DV=512 및 DK=192/DV=128.
  • 새로운 커널은 attention sinks, ALiBi 및 logit softcap 메커니즘을 지원합니다.
  • CPU, GPU (CUDA 12/13, Vulkan, ROCm 10.0) 및 NPU (Snapdragon Hexagon) 백엔드를 위한 사전 빌드된 바이너리가 제공됩니다.

이 릴리스는 지원되는 하드웨어 구성에서 더 효율적인 어텐션 연산을 가능하게 합니다.