Proyek llama.cpp telah merilis versi b10514, yang memperkenalkan infrastruktur konversi untuk arsitektur IBM's GraniteSWAForCausalLM dan GraniteMoeSWAForCausalLM. Pembaruan ini memungkinkan pengguna mengonversi tipe model spesifik ini ke format GGUF untuk digunakan dengan llama.cpp.
- Ditambahkan dukungan feat(convert) untuk GraniteSWAForCausalLM dan GraniteMoeSWAForCausalLM.
- Diimplementasikan infrastruktur konversi untuk array rope_pattern dan penentuan rope per-layer.
- Diperbaiki logika pola SWA untuk mendukung layer non-rope dan diperbaiki penamaan untuk ffn gate inp.
- Diperbarui llama_hparams dengan konstanta has_rope dan dihapus fallbacks rope_finetuned yang hacky.
- Disertakan biner untuk macOS, Linux, Windows, dan Android melalui CPU, CUDA, Vulkan, OpenCL, dan backend lainnya.
Rilis ini memungkinkan ekosistem llama.cpp mendukung secara native model IBM's sliding window attention, memperluas rentang arsitektur kompatibel yang tersedia untuk inferensi lokal.