O projeto llama.cpp lançou a versão b10241, que aborda um bug crítico no backend do CUDA. A atualização resolve as data-races que ocorriam ao reutilizar a memória compartilhada (SMEM) durante reduções em bloco.

  • Corrige a falta de resync após a leitura do SMEM no block_reduce para prevenir data-races.
  • Implementa double-buffering para operações de softmax e normalização de linha única.
  • Adiciona comentários explicativos e barreiras de memória especificamente para cenários multi-warp.
  • Fornece binários para macOS, Linux, Windows, Android e iOS através de CPU, CUDA, Vulkan, ROCm e outros backends.