Proyek llama.cpp merilis versi b11403, yang mencakup optimasi CUDA untuk menggunakan kernel MMVF untuk perkalian matriks f16 dan bf16 tipis pada ukuran batch kecil.
- Logika pemilihan kernel disesuaikan untuk meningkatkan kinerja pada GPU NVIDIA.
- Menyediakan biner untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android, dan openEuler.
- Termasuk XCFramework iOS dan build UI bersama dengan biner standar.