llama.cpp 프로젝트는 빌드 b10985을 출시하여 해시 기반 캐싱을 가중치 텐서로만 제한하도록 RPC 백엔드를 수정했습니다. 이 변경은 활성화 데이터가 불필요하게 해시되고 저장되어 디스크 사용량이 과도해지는 문제를 해결합니다.

  • `ggml_backend_rpc_buffer_set_tensor` 및 `ggml_backend_rpc_set_tensor_async` 함수는 이제 `GGML_BACKEND_BUFFER_USAGE_WEIGHTS`로 표시된 버퍼에 대한 전송만 해시합니다.
  • SET_TENSOR 메시지 내의 새로운 `cache_flag` 바이트는 캐시 항목을 저장해야 할 시기를 신호하며, 이전 서버 측 대기 상태 로직을 대체합니다.

이 최적화는 계산 데이터가 디스크 공간을 채우는 것을 방지하여 가중치만 해시 경로를 통해 캐싱되도록 합니다.