Peneliti mengusulkan APEx, sebuah kerangka pemanfaatan pengalaman hierarkis yang mengorganisir riwayat interaksi menjadi memori trajektori tingkat instance dan keterampilan prosedural tingkat kategori untuk meningkatkan agen penelitian mendalam.

  • Sistem menggabungkan memori-memori ini melalui arsitektur loop tertutup yang terdiri dari modul Executor, Distiller, dan Planner.
  • Modul-modul ini dioptimalkan melalui paradigma pelatihan GRPO bergantian tiga tahap untuk distilasi keterampilan yang dipandu oleh reward.
  • Pada saat pengujian, keterampilan yang telah didistilasi berfungsi sebagai prior prosedural untuk adaptasi Planner online menggunakan pembelajaran penguatan saat pengujian yang dipandu oleh keterampilan.
  • Eksperimen pada 7 benchmark menunjukkan bahwa APEx melampaui GPT-5.4 sebesar 14,7 poin dan baseline penguat memori terkuat sebesar 3,0 poin.

APEx memungkinkan peningkatan diri tanpa ground-truth dengan regularisasi keselarasan keterampilan untuk mencegah drift kebijakan, mencapai kinerja terbaik pada pertanyaan kompleks.