Proyek llama.cpp merilis versi b10094, memperkenalkan fitur yang secara otomatis mendeteksi tipe decoding spekulatif dari sidecar repositori draf. Sebelumnya, saat menggunakan flag `-hfd` untuk menunjuk ke repositori yang berisi sidecar mtp-, dflash-, atau eagle3- tanpa secara eksplisit menyediakan `--spec-type`, sistem akan salah menyelesaikan draf sebagai model penuh.

Dengan pembaruan ini, jika tidak ada tipe spekulatif yang ditentukan, llama-server menemukan sidecar yang tersedia di repositori draf dan memilih yang pertama berdasarkan urutan prioritas mtp, dflash, lalu eagle3. Ini memungkinkan pengguna menjalankan perintah seperti `llama-server -hf repo:Q3_K_M -hfd repo:Q8_0` tanpa flag tambahan. Argumen `--spec-type` yang eksplisit masih menonaktifkan inferensi otomatis ini.

Rilis ini mencakup biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (Ubuntu x64/arm64/s390x dengan CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android arm64, Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP), dan openEuler.