llama.cpp 项目发布了构建版本 b10985,修改了 RPC 后端,将基于哈希的缓存严格限制为权重张量。此更改解决了一个问题:激活数据被不必要地哈希和存储,导致磁盘使用量过大。

  • `ggml_backend_rpc_buffer_set_tensor` 和 `ggml_backend_rpc_set_tensor_async` 函数现在仅对标记为 `GGML_BACKEND_BUFFER_USAGE_WEIGHTS` 的缓冲区进行传输哈希。
  • SET_TENSOR 消息中的新 `cache_flag` 字节指示何时应保存缓存条目,取代了之前的服务器端挂起状态逻辑。

此优化通过确保仅通过哈希路径缓存权重,防止计算数据占用磁盘空间。