llama.cpp 프로젝트는 양자화된 디코딩 시 CUDA에서 벡터와 텐서 코어 경로 간의 크로스오버를 조정하기 위한 하드웨어별 전환 지점을 도입한 빌드 b10534를 출시했습니다.
- 릴리스는 mul_mat_vec_q에서 MMQ로 커널이 전환되는 배치 크기 임계값을 조정하기 위해 GGML_CUDA_MMVQ_MAX를 통한 런타임 구성을 추가합니다.
- Blackwell, DGX Spark, Ada 아키텍처에 대한 특정 전환 지점 값이 포함되어 환경 변수에 대한 의존성을 줄였습니다.
- 이 임계값을 낮추면 더 큰 배치를 int8 MMQ 텐서 코어 경로로 라우팅하여 RTX 5090에서 Q4_K 밀집 모델의 배치 크기 8에서 측정된 23-41% 속도 향상을 가져옵니다.
- 이 업데이트에는 CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL 백엔드 전반에 걸쳐 macOS, Linux, Windows, Android, openEuler용 바이너리가 포함됩니다.
이 변경사항은 배치 크기와 하드웨어 기능에 따라 가장 효율적인 커널 경로를 자동으로 선택하여 최신 NVIDIA GPU의 추론 성능을 향상시킵니다.