llama.cpp 프로젝트는 Vulkan 백엔드를 위한 특정 최적화를 포함한 빌드 b10757을 출시했습니다. 이 업데이트는 NUM_COLS가 4보다 클 때 IQ3_S 행렬-벡터 곱셈에 대해 4보다 큰 더 큰 배치 크기를 효율적으로 처리합니다.
- 지정된 Vulkan IQ3_S mat-vec 구성에서 n=8일 때 5배 성능 개선을 달성합니다.
- all_types mat-vec 스윕에 k=16*256에서 양자화 유형당 두 가지 경우를 추가합니다.
- macOS (Apple Silicon 및 Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) 및 openEuler용 바이너리를 제공합니다.
이 릴리스는 특정 양자화 유형에 대해 업데이트된 Vulkan 최적화와 함께 다양한 하드웨어 플랫폼에서 llama.cpp를 실행할 수 있도록 합니다.