llama.cpp 프로젝트는 버전 b10907을 출시했으며, 여기에는 멀티 토큰 예측(MTP) 컨텍스트 키-값 캐시 할당에 대한 수정이 포함되어 있습니다. 이 업데이트는 deepseek2, glm4moe 및 cohere2moe 아키텍처에 영향을 미치는 문제를 해결합니다.

  • deepseek2, glm4moe 및 cohere2moe 모델의 MTP 컨텍스트 kv 캐시 할당을 수정합니다.
  • MTP 레이어 필터링을 위해 역방향 아키텍처 게이팅과 포괄적인 아키텍처 테스트를 추가합니다.
  • NextN 필터 주석을 간소화하고 test-llama-archs 변경 사항을 제거합니다.

이 릴리스는 macOS (Apple Silicon 및 Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) 및 openEuler에 대한 바이너리를 제공합니다.