Проект llama.cpp выпустил версию b10094, в которой появилась функция автоматического определения типа спекулятивного декодирования по боковым репозиториям черновика. Ранее при использовании флага `-hfd` для указания репозитория, содержащего боковые файлы mtp-, dflash- или eagle3-, без явного указания `--spec-type`, система ошибочно определяла черновик как полную модель.
С этим обновлением, если тип спекулятивного вывода не указан, llama-server обнаруживает доступные боковые репозитории в репозитории черновика и выбирает первый на основе приоритета: mtp, затем dflash, затем eagle3. Это позволяет пользователям запускать команды вроде `llama-server -hf repo:Q3_K_M -hfd repo:Q8_0` без дополнительных флагов. Явный аргумент `--spec-type` всё ещё отключает это автоматическое определение.
Релиз включает бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (Ubuntu x64/arm64/s390x с CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android arm64, Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) и openEuler.