El proyecto llama.cpp lanzó la versión b10413, que introduce la detección automática del tipo de especificación de descodificación especulativa directamente desde los metadatos del modelo GGUF de borrador.

  • Detecta automáticamente el tipo de especificación leyendo `general.architecture` del encabezado GGUF de borrador y asignando tensores como `dflash` y `markov_w1.weight` a `draft-dspark` o `draft-dflash`.
  • Corrige un problema en el que la carga de modelos locales de borrador sin especificar explícitamente `--spec-type` dejaba la descodificación especulativa inactiva (tipo NONE).
  • Mueve la lógica de detección del tipo de especificación al módulo especulativo utilizando patrones RAII y añade registro para informar a los usuarios cuando ocurre la detección automática.
  • Proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm) y openEuler.

Este cambio asegura que la descodificación especulativa se active correctamente para los modelos locales de borrador sin requerir la configuración manual del tipo de especificación.