O projeto llama.cpp lançou a versão b10690, que inclui uma correção crítica para caches de chave-valor não quantizados. A atualização impede crashes que ocorriam durante as mudanças de contexto, garantindo que a matriz de Hadamard seja copiada para o tensor k_rot apenas quando ele tiver um buffer atribuído.
- Corrige crash no K cache não quantizado durante a mudança de contexto copiando condicionalmente a matriz de Hadamard
- Fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler
- Inclui atualizações da interface do usuário e atestações para o lançamento