Le projet llama.cpp a publié la version b10241, qui résout un bug critique dans le backend CUDA. La mise à jour corrige les data-races survenant lors de la réutilisation de la mémoire partagée (SMEM) pendant les réductions par blocs.

  • Corrige l'absence de resync après la lecture depuis SMEM dans block_reduce pour prévenir les data-races.
  • Implémente le double-buffering pour les opérations softmax et de normalisation à ligne unique.
  • Ajoute des commentaires explicatifs et des barrières mémoire spécifiquement pour les scénarios multi-warp.
  • Fournit des binaires pour macOS, Linux, Windows, Android et iOS via CPU, CUDA, Vulkan, ROCm et autres backends.