llama.cpp 프로젝트가 키-값(KV) 캐시 처리에 대한 성능 최적화를 포함하는 버전 b10707을 출시했습니다. 이번 업데이트는 모든 가능한 최대 시퀀스를 반복하는 대신 특정 셀 내의 모든 시퀀스가 확인되면 스캔을 중단하도록 `for_each_token_in` 함수를 수정합니다.

  • 이 변경은 `get_prev_tokens` 호출자를 통해 n-gram 경로를 대상으로 합니다.
  • RTX PRO 6000에서 Qwen3.8-Flash-Next UD-Q4_K_XL 모델을 사용할 때, 55k 컨텍스트에서 생성 속도가 초당 56.3 토큰에서 74.3 토큰으로 증가했습니다.
  • 132k 컨텍스트에서는 생성 속도가 초당 33.6 토큰에서 50.9 토큰으로 개선되었습니다.
  • 이 최적화는 사용된 셀의 수에 따라 확장되므로 긴 컨텍스트에서 성능 향상이 더 두드러지며 프롬프트 처리에는 영향을 주지 않습니다.

이번 릴리스는 macOS(Apple Silicon 및 Intel), Linux(CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows(CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm) 및 openEuler용 바이너리를 제공합니다.