Proyek llama.cpp merilis versi b11132, memperkenalkan dukungan untuk backbone draf Gemma 4 DSpark. Pembaruan ini mengaktifkan konversi GGUF dan kemampuan runtime untuk draf Gemma 4 dengan perhatian penuh dan SWA, termasuk bobot output terikat dan metadata backbone boolean.
- Menambahkan dukungan dspark untuk model draf Gemma 4 dengan varian perhatian penuh dan SWA.
- Mengimplementasikan inferensi fitur draf Gemma dari metadata melalui mekanisme dflash.
- Melepaskan biner untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android, dan iOS.
Rilis ini memungkinkan pengguna memanfaatkan model Gemma 4 dalam ekosistem llama.cpp di berbagai platform perangkat keras.