A versão llama.cpp b10081 corrige um bug onde a flag `--hfd` apontava para um repositório contendo sidecars especulativos, mas o plano de rascunho resolvia incorretamente para o modelo principal em vez do sidecar. Isso ocorreu porque `find_best_model()` excluía arquivos de sidecar e o plano de rascunho explícito suprimia a descoberta de sidecars.
A correção conecta os sidecars descobertos como o rascunho, seguindo o padrão de fallback do plano principal, permitindo que comandos como `llama-server -hf repo -hfd repo --spec-type draft-dflash` funcionem conforme esperado.
Esta versão inclui binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) e openEuler.