Le projet llama.cpp a publié la version b10412, qui introduit le support de l'échantillonnage backend pour les backends dflash et dspark. Cette mise à jour permet également des valeurs p_min supérieures à 0 dans la logique d'échantillonnage backend et ajoute les sauvegardes correspondantes.

  • Active l'échantillonnage backend pour dflash et dspark.
  • Permet p_min > 0 dans l'échantillonnage backend avec des garde-fous ajoutés.
  • Fournit des binaires pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler.

Cette version élargit les options d'accélération matérielle disponibles pour les utilisateurs de llama.cpp.