Le projet llama.cpp a publié la compilation b10148, traitant des problèmes de configuration du décodage spéculatif et de la journalisation. La mise à jour garantit que les arguments de ligne de commande explicites pour les modèles draft ont la priorité sur la résolution automatique du sidecar.
- Les drapeaux --model-draft explicites désactivent désormais la résolution automatique du sidecar, permettant à la configuration CLI manuelle de remplacer le comportement par défaut.
- La logique de sélection du sidecar a été mise à jour pour s'ancrer sur la balise du modèle principal, permettant des correspondances exactes ou un retour à la quantification la plus proche.
- Les logs de chargement spéculatif ont été promus du niveau trace au niveau info, rendant la visibilité du contexte du modèle draft et MTP cohérente avec les autres logs système.
Ces modifications améliorent la fiabilité pour les utilisateurs dépendant des spécifications manuelles des modèles draft et fournissent une journalisation opérationnelle plus claire.