Proyek llama.cpp telah merilis versi b10206, yang memperkenalkan perubahan spesifik pada penanganan cache kunci-nilai dalam mekanisme perhatian. Pembaruan ini memastikan bahwa jenis cache K dan V tetap konsisten untuk model DeepSeek V4.

  • Menerapkan jenis cache K dan V yang identik untuk arsitektur DeepSeek V4.
  • Mengaktifkan Flash Attention (FA) ketika cache V dikuantisasi.
  • Menerapkan penerapan jenis cache K dan V yang sama ke model MLA lainnya.

Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler di berbagai backend perangkat keras termasuk CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL, dan OpenCL.