Proyek llama.cpp telah merilis versi 0.2.0, yang menyertakan sinkronisasi dengan pustaka ggml yang ditingkatkan ke versi 0.21.0. Pembaruan ini memperkenalkan beberapa peningkatan backend dan fitur baru di berbagai platform perangkat keras.
- Menambahkan dukungan kernel Kleidiai SME2 F32 GEMV untuk kinerja yang lebih baik pada perangkat keras yang kompatibel.
- Mengaktifkan fungsi pemisahan tensor untuk model LFM2 dan LFM2MOE guna meningkatkan distribusi multi-GPU.
- Menerapkan dukungan DSpark untuk model LFM2 dalam pipa pemuatan model.
- Memperbarui backend SYCL dengan Q2_K reordered MMVQ, kernel ESIMD, serta perbaikan untuk GPU Alchemist dan masalah mlock.
- Meningkatkan stabilitas OpenCL dengan perbaikan untuk kompilator Adreno A6x/A7x dan perhitungan ukuran lokal.
- Menambahkan argumen --mmproj-device ke mtmd untuk menentukan penempatan perangkat proyeksi multimodal.
Rilis ini juga menyertakan pembersihan CI, peningkatan navigasi pengaturan UI, serta berbagai perbaikan bug untuk backend CUDA, Metal, dan Vulkan.