Proyek llama.cpp merilis build b10985, yang memodifikasi backend RPC untuk membatasi caching berbasis hash secara eksklusif ke tensor bobot. Perubahan ini mengatasi masalah di mana data aktivasi tidak perlu di-hash dan disimpan, menyebabkan penggunaan disk yang berlebihan.

  • Fungsi `ggml_backend_rpc_buffer_set_tensor` dan `ggml_backend_rpc_set_tensor_async` sekarang hanya meng-hash transfer untuk buffer yang ditandai dengan `GGML_BACKEND_BUFFER_USAGE_WEIGHTS`.
  • Byte `cache_flag` baru dalam pesan SET_TENSOR menandakan kapan entri cache harus disimpan, menggantikan logika status pending sisi server sebelumnya.

Optimisasi ini mencegah data komputasi memenuhi ruang disk dengan memastikan hanya bobot yang di-cache melalui jalur hash.