Proyek llama.cpp merilis versi b10413, yang memperkenalkan deteksi otomatis tipe spesifikasi decoding spekulatif langsung dari metadata model GGUF draf.

  • Mendeteksi tipe spec secara otomatis dengan membaca `general.architecture` dari header GGUF draf dan memetakan tensor seperti `dflash` dan `markov_w1.weight` ke `draft-dspark` atau `draft-dflash`.
  • Memperbaiki masalah di mana pemuatan model draf lokal tanpa menentukan `--spec-type` secara eksplisit menyebabkan decoding spekulatif tetap tidak aktif (tipe NONE).
  • Memindahkan logika deteksi tipe spec ke modul spekulatif menggunakan pola RAII dan menambahkan logging untuk memberi tahu pengguna ketika deteksi otomatis terjadi.
  • Menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm), dan openEuler.

Perubahan ini memastikan bahwa decoding spekulatif diaktifkan dengan benar untuk model draf lokal tanpa memerlukan konfigurasi manual tipe spesifikasi.