El proyecto llama.cpp lanzó la versión b10094, introduciendo una función que detecta automáticamente el tipo de decodificación especulativa a partir de los sidecars del repositorio de borrador. Anteriormente, al usar la bandera `-hfd` para apuntar a un repositorio que contiene sidecars mtp-, dflash- o eagle3- sin proporcionar explícitamente `--spec-type`, el sistema resolvía incorrectamente el borrador como un modelo completo.

Con esta actualización, si no se especifica ningún tipo especulativo, llama-server descubre los sidecars disponibles en el repositorio de borrador y selecciona el primero según el orden de prioridad de mtp, dflash y luego eagle3. Esto permite a los usuarios ejecutar comandos como `llama-server -hf repo:Q3_K_M -hfd repo:Q8_0` sin banderas adicionales. Un argumento `--spec-type` explícito desactiva esta inferencia automática.

El lanzamiento incluye binarios para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu x64/arm64/s390x con CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android arm64, Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) y openEuler.