Проект llama.cpp выпустил версию b10690, которая включает критическое исправление для некваантизованных key-value кэшей. Обновление предотвращает сбои, возникающие при смене контекста, обеспечивая копирование матрицы Адамара в тензор k_rot только при наличии назначенного буфера.
- Исправляет краш в K cache без квантования при смене контекста путем условного копирования матрицы Адамара
- Предоставляет бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android и openEuler
- Включает обновления интерфейса и аттестации выпуска