O projeto llama.cpp lançou a versão b10241, que aborda um bug crítico no backend do CUDA. A atualização resolve as data-races que ocorriam ao reutilizar a memória compartilhada (SMEM) durante reduções em bloco.
- Corrige a falta de resync após a leitura do SMEM no block_reduce para prevenir data-races.
- Implementa double-buffering para operações de softmax e normalização de linha única.
- Adiciona comentários explicativos e barreiras de memória especificamente para cenários multi-warp.
- Fornece binários para macOS, Linux, Windows, Android e iOS através de CPU, CUDA, Vulkan, ROCm e outros backends.