Проект llama.cpp выпустил сборку b11017, которая включает оптимизацию Vulkan для пропуска избыточной работы Mixture of Experts (MoE) в пути mul_mm coopmat1.
Это обновление предоставляет предварительно собранные бинарные файлы для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android и openEuler.
Выпуск также включает пользовательский интерфейс llama.cpp.