Проект llama.cpp выпустил версию b11403, которая включает оптимизацию CUDA для использования ядра MMVF для тонких матричных умножений f16 и bf16 при малых размерах батчей.
- Настроена логика выбора ядра для улучшения производительности на GPU NVIDIA.
- Предоставлены бинарные файлы для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android и openEuler.
- Включены iOS XCFramework и сборки UI вместе со стандартными бинарными файлами.