Проект llama.cpp выпустил сборку b10985, которая изменяет RPC-бэкенд, чтобы ограничить хеш-кэширование исключительно тензорами весов. Это изменение решает проблему, когда данные активации ненужно хешировались и сохранялись, что приводило к чрезмерному использованию диска.

  • Функции `ggml_backend_rpc_buffer_set_tensor` и `ggml_backend_rpc_set_tensor_async` теперь хешируют передачи только для буферов, помеченных как `GGML_BACKEND_BUFFER_USAGE_WEIGHTS`.
  • Новый байт `cache_flag` в сообщении SET_TENSOR сигнализирует о том, когда следует сохранять запись кэша, заменяя предыдущую логику состояния ожидания на стороне сервера.

Эта оптимизация предотвращает заполнение дискового пространства вычислительными данными, обеспечивая кэширование только весов через хеш-путь.