El proyecto llama.cpp ha lanzado la versión b10690, que incluye una corrección crítica para los cachés de clave-valor sin cuantizar. La actualización previene bloqueos que ocurrían durante los cambios de contexto al asegurar que la matriz de Hadamard se copie en el tensor k_rot solo cuando tiene un búfer asignado.
- Corrige el bloqueo en el K cache no cuantizado durante el cambio de contexto copiando condicionalmente la matriz de Hadamard
- Proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android y openEuler
- Incluye actualizaciones de la interfaz de usuario y atestaciones para el lanzamiento