El proyecto llama.cpp lanzó la compilación b10985, que modifica el backend RPC para limitar el almacenamiento en caché basado en hash exclusivamente a tensores de pesos. Este cambio aborda un problema donde los datos de activación se hashaban y almacenaban innecesariamente, lo que provocaba un uso excesivo del disco.

  • Las funciones `ggml_backend_rpc_buffer_set_tensor` y `ggml_backend_rpc_set_tensor_async` ahora solo hashan transferencias para búferes marcados con `GGML_BACKEND_BUFFER_USAGE_WEIGHTS`.
  • Un nuevo byte `cache_flag` en el mensaje SET_TENSOR indica cuándo se debe guardar una entrada de caché, reemplazando la lógica anterior del estado pendiente del servidor.

Esta optimización evita que los datos de cómputo llenen el espacio en disco asegurando que solo los pesos se almacenen en caché a través de la ruta hash.