Para peneliti memperkenalkan ReFold, lapisan rendering tanpa pelatihan yang mengompresi konteks yang dirender oleh model dalam agen LLM jangka panjang tanpa membuang riwayat interaksi mendasarnya. Metode ini menghilangkan redundansi antar giliran dengan mengganti konten yang ditampilkan dengan stub dan melipat giliran yang selesai menjadi catatan, menggunakan rendering terpotong untuk menulis ulang awalan cache secara berkala.

  • ReFold menghilangkan dua jenis redundansi antar giliran: konten yang pernah ditampilkan dan giliran yang telah selesai dilaporkan oleh agen.
  • Metode ini menggunakan rendering terpotong untuk memperbarui awalan cache setiap beberapa langkah, bukan pada setiap langkah.
  • Semua penghapusan bersifat sepenuhnya reversibel, memungkinkan pemulihan dari riwayat jika penghapusan salah.
  • Evaluasi di lima benchmark dan dua LLM terdepan menunjukkan pengurangan konsumsi token hingga 2.5x dan pengurangan memori KV-cache menjadi setengahnya.
  • Di bawah anggaran konteks yang dibatasi, ReFold menghindari hingga 92% kompresi paksa.
  • Dalam beban kerja penyiapan konkuren, metode ini mengurangi penundaant antrean permintaan hingga 100%, mempercepat inferensi hingga 1.7x, dan memangkas biaya hingga 3.4x.

ReFold dirancang sebagai solusi plug-and-play untuk harness bergaya ReAct standar, mengatasi keterbatasan metode manajemen konteks prediktif yang ada yang memperkenalkan overhead waktu eksekusi dan membatalkan cache awalan.