Le projet llama.cpp a publié la version b10985, qui modifie le backend RPC pour limiter le stockage en cache basé sur le hachage exclusivement aux tenseurs de poids. Cette modification résout un problème où les données d'activation étaient inutilement hashées et stockées, entraînant une utilisation excessive du disque.
- Les fonctions `ggml_backend_rpc_buffer_set_tensor` et `ggml_backend_rpc_set_tensor_async` ne hashent désormais que les transferts pour les tampons marqués avec `GGML_BACKEND_BUFFER_USAGE_WEIGHTS`.
- Un nouveau byte `cache_flag` dans le message SET_TENSOR indique quand une entrée de cache doit être sauvegardée, remplaçant la logique précédente de l'état en attente côté serveur.
Cette optimisation empêche les données de calcul de remplir l'espace disque en s'assurant que seuls les poids sont mis en cache via le chemin hash.