Proyek llama.cpp merilis versi b10413, yang memperkenalkan deteksi otomatis tipe spesifikasi decoding spekulatif langsung dari metadata model GGUF draf.
- Mendeteksi tipe spec secara otomatis dengan membaca `general.architecture` dari header GGUF draf dan memetakan tensor seperti `dflash` dan `markov_w1.weight` ke `draft-dspark` atau `draft-dflash`.
- Memperbaiki masalah di mana pemuatan model draf lokal tanpa menentukan `--spec-type` secara eksplisit menyebabkan decoding spekulatif tetap tidak aktif (tipe NONE).
- Memindahkan logika deteksi tipe spec ke modul spekulatif menggunakan pola RAII dan menambahkan logging untuk memberi tahu pengguna ketika deteksi otomatis terjadi.
- Menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm), dan openEuler.
Perubahan ini memastikan bahwa decoding spekulatif diaktifkan dengan benar untuk model draf lokal tanpa memerlukan konfigurasi manual tipe spesifikasi.