O projeto llama.cpp lançou a versão b10094, introduzindo um recurso que detecta automaticamente o tipo de decodificação especulativa a partir de sidecars do repositório rascunho. Anteriormente, ao usar a flag `-hfd` para apontar para um repositório contendo sidecars mtp-, dflash- ou eagle3- sem fornecer explicitamente `--spec-type`, o sistema resolvia incorretamente o rascunho como um modelo completo.
Com esta atualização, se nenhum tipo especulativo for especificado, o llama-server descobre os sidecars disponíveis no repositório rascunho e seleciona o primeiro com base na ordem de prioridade de mtp, dflash, em seguida eagle3. Isso permite que os usuários executem comandos como `llama-server -hf repo:Q3_K_M -hfd repo:Q8_0` sem flags extras. Um argumento `--spec-type` explícito ainda desativa essa inferência automática.
O lançamento inclui binários para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu x64/arm64/s390x com CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android arm64, Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) e openEuler.