Proyek llama.cpp telah merilis versi b10830, memperkenalkan opsi baris perintah baru untuk konversi model. Pembaruan ini menambahkan flag `--fuse-qkv`, yang memungkinkan pengguna menggabungkan matriks Query, Key, dan Value menjadi satu struktur QKV selama konversi dari format Hugging Face ke GGUF.
- Rilis ini mencakup biner untuk macOS (Apple Silicon dan Intel), Linux (Ubuntu dengan backend CPU, Vulkan, ROCm, OpenVINO, dan SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, OpenVINO, dan SYCL), dan openEuler.
- Dukungan iOS disediakan melalui XCFramework, sementara dukungan KleidiAI di macOS Apple Silicon saat ini dinonaktifkan.
Pembaruan ini memberikan jalur konversi yang lebih efisien bagi pengguna untuk model yang diuntungkan oleh mekanisme perhatian yang digabungkan.