O projeto llama.cpp lançou a versão b11403, que inclui uma otimização de CUDA para usar o kernel MMVF para multiplicações de matriz f16 e bf16 finas em tamanhos de lote pequenos.
- Lógica de seleção de kernel ajustada para melhorar o desempenho em GPUs NVIDIA.
- Binários fornecidos para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.
- Incluídos XCFramework da iOS e builds de UI junto com os binários padrão.