O projeto llama.cpp lançou a compilação b10985, que modifica o backend RPC para limitar o armazenamento em cache baseado em hash exclusivamente a tensores de peso. Esta alteração aborda um problema onde os dados de ativação eram desnecessariamente hashados e armazenados, levando ao uso excessivo do disco.
- As funções `ggml_backend_rpc_buffer_set_tensor` e `ggml_backend_rpc_set_tensor_async` agora apenas hasham transferências para buffers marcados com `GGML_BACKEND_BUFFER_USAGE_WEIGHTS`.
- Um novo byte `cache_flag` na mensagem SET_TENSOR sinaliza quando uma entrada de cache deve ser salva, substituindo a lógica anterior do estado pendente no lado do servidor.
Esta otimização impede que dados de computação preencham o espaço em disco, garantindo que apenas os pesos sejam armazenados em cache via caminho de hash.