llama.cpp 프로젝트는 oneDNN SDPA 경로에 대한 성능 최적화를 포함하는 버전 b10669을 출시했으며, 이는 f16 KV 캐시를 인플레이스 바인딩하여 구현되었습니다.
- 이 변경은 프리필 청크 동안 메모리 트래픽을 줄입니다. 예를 들어, 라이브 KV 길이가 34816인 Qwen3.8 27B에서 단계적 복사를 피함으로써 ubatch당 트래픽을 4.56 GB에서 더 낮은 수준으로 낮춥니다.
- 바이너리는 macOS (Apple Silicon 및 Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) 및 openEuler에서 사용할 수 있습니다.
이 업데이트는 광범위한 플랫폼 호환성을 유지하면서 지원되는 하드웨어에서 최적화된 추론 성능을 사용자에게 제공합니다.