Проект llama.cpp выпустил версию b10690, которая включает критическое исправление для некваантизованных key-value кэшей. Обновление предотвращает сбои, возникающие при смене контекста, обеспечивая копирование матрицы Адамара в тензор k_rot только при наличии назначенного буфера.

  • Исправляет краш в K cache без квантования при смене контекста путем условного копирования матрицы Адамара
  • Предоставляет бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android и openEuler
  • Включает обновления интерфейса и аттестации выпуска