llama.cpp 프로젝트는 ggml-webgpu 백엔드에 대한 주요 개선을 포함하는 버전 b10201을 출시했습니다. 이 업데이트는 긴 컨텍스트 생성 동안 양자화된 키-값 캐시를 처리할 때 flash attention 성능을 향상시킵니다.
- ggml-webgpu에서 양자화된 KV 캐시에 대한 flash attention 벡터 처리 개선.
- 값 유형 확인 관련 버그 수정 및 주석 업데이트.
- rebase로 인한 빌드 오류 해결.
- macOS (Apple Silicon, Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, HIP, OpenVINO, SYCL) 및 openEuler용 바이너리 제공.
이 릴리스를 통해 사용자는 더 긴 시퀀스에 대해 최적화된 어텐션 메커니즘의 혜택을 받으면서 광범위한 하드웨어 플랫폼에서 llama.cpp를 실행할 수 있습니다.