Проект llama.cpp выпустил версию b10635, включающую специфические обновления поддержки CUDA. Основное изменение — разблокировка смешанной точности матричного умножения (mmq) для архитектур Mixture of Experts (MoE) на GPU с вычислительной способностью 6.0 (sm_60).
- CUDA: Разблокирован mmq для MoE на sm_60.
- CUDA: Дублирование mmq-config-pascal для dp4a и более старых архитектур.
- CUDA: Снижение загрузки на GPU Pascal без dp4a для форматов квантования Q2_K, Q4_K, Q5_K и Q6_K.
Этот релиз предоставляет бинарные файлы для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android и openEuler.