Проект llama.cpp выпустил сборку b10985, которая изменяет RPC-бэкенд, чтобы ограничить хеш-кэширование исключительно тензорами весов. Это изменение решает проблему, когда данные активации ненужно хешировались и сохранялись, что приводило к чрезмерному использованию диска.
- Функции `ggml_backend_rpc_buffer_set_tensor` и `ggml_backend_rpc_set_tensor_async` теперь хешируют передачи только для буферов, помеченных как `GGML_BACKEND_BUFFER_USAGE_WEIGHTS`.
- Новый байт `cache_flag` в сообщении SET_TENSOR сигнализирует о том, когда следует сохранять запись кэша, заменяя предыдущую логику состояния ожидания на стороне сервера.
Эта оптимизация предотвращает заполнение дискового пространства вычислительными данными, обеспечивая кэширование только весов через хеш-путь.