Le projet llama.cpp a publié la compilation b10835, qui inclut une correction pour un problème de barrière divergente dans l'implémentation de ggml-cuda pour l'attention flash f16. Cette mise à jour traite également la configuration dupliquée du pointeur de métadonnées dans le même module.

  • Corrige la barrière divergente dans ggml-cuda attention flash f16 (PR #27870).
  • Empêche la configuration dupliquée du pointeur de métadonnées dans ggml-cuda.

Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et openEuler sur divers backends CPU et GPU incluant CUDA, Vulkan, ROCm et SYCL.