Le projet llama.cpp a publié la version b10690, qui inclut une correction critique pour les caches clé-valeur non quantifiés. La mise à jour empêche les plantages survenant lors des changements de contexte en s'assurant que la matrice de Hadamard est copiée dans le tenseur k_rot uniquement lorsqu'elle dispose d'un tampon assigné.
- Corrige le plantage du cache K non quantifié lors du changement de contexte en copiant conditionnellement la matrice de Hadamard
- Fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler
- Inclut des mises à jour de l'interface utilisateur et des attestations pour la version