Proyek llama.cpp telah merilis versi b10690, yang mencakup perbaikan kritis untuk cache kunci-nilai yang tidak dikuantisasi. Pembaruan ini mencegah crash yang terjadi selama pergantian konteks dengan memastikan matriks Hadamard disalin ke tensor k_rot hanya ketika memiliki buffer yang ditetapkan.

  • Memperbaiki crash pada K cache tidak terkuantisasi saat pergantian konteks dengan menyalin matriks Hadamard secara kondisional
  • Menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android, dan openEuler
  • Termasuk pembaruan UI dan atestasi untuk rilis