Le projet llama.cpp a publié la version b11403, qui inclut une optimisation CUDA pour utiliser le noyau MMVF pour les multiplications de matrices f16 et bf16 fines à de petites tailles de lot.
- Logique de sélection du noyau ajustée pour améliorer les performances sur les GPU NVIDIA.
- Binaires fournis pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler.
- XCFramework iOS et builds UI inclus aux côtés des binaires standard.