El proyecto llama.cpp lanzó la versión b11403, que incluye una optimización de CUDA para usar el kernel MMVF para multiplicaciones de matrices f16 y bf16 delgadas en tamaños de lote pequeños.

  • Lógica de selección de kernel ajustada para mejorar el rendimiento en GPUs NVIDIA.
  • Binarios proporcionados para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android y openEuler.
  • Se incluyeron XCFramework de iOS y compilaciones de UI junto con los binarios estándar.