Проект llama.cpp выпустил версию b10413, которая вводит автоматическое обнаружение типа спецификации спекулятивного декодирования непосредственно из метаданных модели GGUF черновика.
- Автоматически определяет тип спецификации, считывая `general.architecture` из заголовка GGUF черновика и сопоставляя тензоры, такие как `dflash` и `markov_w1.weight`, с `draft-dspark` или `draft-dflash`.
- Исправляет проблему, при которой загрузка локальных моделей черновика без явного указания `--spec-type` приводила к тому, что спекулятивное декодирование оставалось неактивным (тип NONE).
- Перемещает логику обнаружения типа спецификации в модуль спекулятивного декодирования, используя паттерны RAII, и добавляет логирование для информирования пользователей о том, когда происходит автоматическое обнаружение.
- Предоставляет бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm) и openEuler.
Это изменение гарантирует, что спекулятивное декодирование правильно активируется для локальных моделей черновика без необходимости ручной настройки типа спецификации.