O projeto llama.cpp lançou a versão b10413, que introduz a detecção automática do tipo de especificação de decodificação especulativa diretamente dos metadados do modelo GGUF de rascunho.

  • Detecta automaticamente o tipo de especificação lendo `general.architecture` do cabeçalho GGUF de rascunho e mapeando tensores como `dflash` e `markov_w1.weight` para `draft-dspark` ou `draft-dflash`.
  • Corrige um problema em que o carregamento de modelos locais de rascunho sem especificar explicitamente `--spec-type` resultava na decodificação especulativa permanecendo inativa (tipo NONE).
  • Move a lógica de detecção do tipo de especificação para o módulo especulativo usando padrões RAII e adiciona registros para informar os usuários quando a detecção automática ocorre.
  • Fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm) e openEuler.

Esta alteração garante que a decodificação especulativa seja ativada corretamente para modelos locais de rascunho sem exigir configuração manual do tipo de especificação.