Le projet llama.cpp a publié la version b10094, introduisant une fonctionnalité qui détecte automatiquement le type de décodage spéculatif à partir des sidecars du dépôt de modèle. Auparavant, lors de l'utilisation du drapeau `-hfd` pour pointer vers un dépôt contenant des sidecars mtp-, dflash- ou eagle3- sans fournir explicitement `--spec-type`, le système résolvait incorrectement le modèle comme étant un modèle complet.

Avec cette mise à jour, si aucun type spéculatif n'est spécifié, llama-server découvre les sidecars disponibles dans le dépôt de modèle et sélectionne le premier selon l'ordre de priorité mtp, dflash, puis eagle3. Cela permet aux utilisateurs d'exécuter des commandes telles que `llama-server -hf repo:Q3_K_M -hfd repo:Q8_0` sans drapeaux supplémentaires. Un argument `--spec-type` explicite désactive toujours cette inférence automatique.

La version inclut des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (Ubuntu x64/arm64/s390x avec CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android arm64, Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) et openEuler.