Le projet llama.cpp a publié la version b10355, introduisant le support de l'échantillonnage backend multi-sortie. Cette mise à jour permet de combiner l'échantillonnage backend avec la spéculation de tokens et ajoute un paramètre de contexte numérique pour déclarer le nombre maximum de sorties par séquence.

  • Activer l'échantillonnage backend avec spéculation de tokens
  • Limiter la somme du masque avant de le convertir en index échantillonné
  • Ajouter un paramètre de contexte numérique déclarant les sorties maximales par une séquence
  • Corriger les incohérences entre l'échantillonnage CPU et backend, et aligner la distribution (dist) entre CPU et GPU
  • Simplifier les modifications et corriger les tests sur Vulkan

La version fournit des binaires pour macOS, iOS, Linux, Android, Windows et openEuler via divers backends matériels incluant CPU, CUDA, ROCm, OpenVINO, SYCL, HIP et Vulkan.