llama.cpp 프로젝트는 CUDA 지원에 대한 특정 업데이트를 포함하는 버전 b10635를 출시했습니다. 주요 변경 사항은 계산 능력 6.0 (sm_60) GPU에서 Mixture of Experts (MoE) 아키텍처에 대한 혼합 정밀도 행렬 곱셈(mmq)의 차트를 해제하는 것입니다.
- CUDA: sm_60에서 MoE에 대한 mmq 차단 해제.
- CUDA: dp4a 및 이전 아키텍처에 대해 mmq-config-pascal 복제.
- CUDA: Q2_K, Q4_K, Q5_K 및 Q6_K 양자화 형식에 대해 비-dp4a Pascal GPU에서 점유율 감소.
이 릴리스는 macOS (Apple Silicon 및 Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android 및 openEuler에 대한 바이너리를 제공합니다.