El proyecto llama.cpp lanzó la versión b10241, que aborda un error crítico en el backend de CUDA. La actualización resuelve las carreras de datos que ocurrían al reutilizar la memoria compartida (SMEM) durante las reducciones por bloques.
- Corrige la falta de resincronización después de leer desde SMEM en block_reduce para prevenir carreras de datos.
- Implementa doble almacenamiento en búfer para operaciones de softmax y normalización de una sola fila.
- Añade comentarios explicativos y barreras de memoria específicamente para escenarios multi-warp.
- Proporciona binarios para macOS, Linux, Windows, Android e iOS a través de CPU, CUDA, Vulkan, ROCm y otros backends.