Para peneliti memperkenalkan ReFold, lapisan rendering tanpa pelatihan yang mempertahankan riwayat interaksi sambil mengompresi konteks yang dirender oleh model untuk agen LLM jangka panjang. Ini menghapus redundansi antar giliran dengan mengganti konten yang ditampilkan dengan stub dan melipat giliran selesai menjadi catatan, menggunakan penulisan ulang terpotong untuk menjaga cache prefix.
- Menghapus konten yang sudah ditampilkan di giliran sebelumnya dan melipat giliran selesai yang dilaporkan agen menjadi catatan satu baris.
- Menggunakan rendering terpotong untuk menulis ulang cache prefix sekali setiap beberapa langkah alih-alih di setiap langkah.
- Memastikan semua penghapusan sepenuhnya dapat dibalik, memungkinkan pemulihan dari riwayat jika penghapusan salah.
- Mengurangi konsumsi token hingga 2.5x dan separuh memori KV-cache per sesi tanpa menurunkan tingkat keberhasilan tugas.
- Menghindari hingga 92% kompresi paksa di bawah anggaran konteks terbatas dan mengurangi penundaant antrean permintaan hingga 100%.
ReFold beroperasi sebagai solusi plug-and-play di berbagai harness gaya ReAct standar, mempercepat inferensi hingga 1.7x sambil memangkas biaya inferensi hingga 3.4x.