llama.cpp 프로젝트는 버전 b10206을 출시했으며, 이는 어텐션 메커니즘에서 키-값 캐시를 처리하는 방식에 특정 변경 사항을 도입했습니다. 이 업데이트는 DeepSeek V4 모델의 K 및 V 캐시 유형이 일관되게 유지되도록 보장합니다.

  • DeepSeek V4 아키텍처에 대해 동일한 K 및 V 캐시 유형을 강제합니다.
  • V 캐시가 양자화되어 있을 때 Flash Attention (FA) 을 활성화합니다.
  • 다른 MLA 모델에도 동일한 K 및 V 캐시 유형 강제를 적용합니다.

이 릴리스는 CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL 및 OpenCL을 포함한 다양한 하드웨어 백엔드에 대해 macOS, Linux, Windows, Android 및 openEuler용 바이너리를 제공합니다.