Le projet llama.cpp a publié la version b10413, qui introduit la détection automatique du type de spécification du décodage spéculatif directement à partir des métadonnées du modèle draft GGUF.

  • Détecte automatiquement le type de spécification en lisant `general.architecture` dans l'en-tête GGUF du draft et en mappant les tenseurs tels que `dflash` et `markov_w1.weight` vers `draft-dspark` ou `draft-dflash`.
  • Corrige un problème où le chargement de modèles locaux sans spécifier explicitement `--spec-type` laissait le décodage spéculatif inactif (type NONE).
  • Déplace la logique de détection du type de spécification vers le module spéculatif en utilisant des motifs RAII et ajoute des journaux pour informer les utilisateurs lorsque la détection automatique se produit.
  • Fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm) et openEuler.

Ce changement garantit que le décodage spéculatif s'active correctement pour les modèles locaux sans nécessiter de configuration manuelle du type de spécification.