Proyek llama.cpp merilis versi b10669, yang mencakup optimasi kinerja untuk jalur SDPA oneDNN dengan mengikat cache KV f16 di tempat.
- Perubahan ini mengurangi lalu lintas memori selama chunk prefill; misalnya, pada Qwen3.8 27B dengan panjang KV aktif 34816, hal ini menurunkan lalu lintas per ubatch dari 4,56 GB menjadi lebih sedikit dengan menghindari salinan bertahap.
- Binari tersedia untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.
Pembaruan ini memberikan pengguna kinerja inferensi yang dioptimalkan pada perangkat keras yang didukung sambil mempertahankan kompatibilitas platform yang luas.