Проект llama.cpp выпустил версию b11403, которая включает оптимизацию CUDA для использования ядра MMVF для тонких матричных умножений f16 и bf16 при малых размерах батчей.

  • Настроена логика выбора ядра для улучшения производительности на GPU NVIDIA.
  • Предоставлены бинарные файлы для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android и openEuler.
  • Включены iOS XCFramework и сборки UI вместе со стандартными бинарными файлами.