O projeto llama.cpp lançou a versão b11403, que inclui uma otimização de CUDA para usar o kernel MMVF para multiplicações de matriz f16 e bf16 finas em tamanhos de lote pequenos.

  • Lógica de seleção de kernel ajustada para melhorar o desempenho em GPUs NVIDIA.
  • Binários fornecidos para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.
  • Incluídos XCFramework da iOS e builds de UI junto com os binários padrão.