La version llama.cpp b10081 corrige un bug où le drapeau `--hfd` pointait vers un dépôt contenant des sidecars spéculatifs, mais le plan de brouillon était incorrectement résolu vers le modèle principal au lieu du sidecar. Cela s'est produit car `find_best_model()` excluait les fichiers sidecar et le plan de brouillon explicite supprimait la découverte des sidecars.
La correction relie les sidecars découverts comme le brouillon, en suivant le motif de repli du plan principal, permettant aux commandes telles que `llama-server -hf repo -hfd repo --spec-type draft-dflash` de fonctionner comme prévu.
Cette version inclut des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) et openEuler.