Penelitian AI Google Cloud, bekerja sama dengan UNC-Chapel Hill, Stanford, dan Washington University di St. Louis, telah membuka sumber RRSI (Regularized Recursive Self-Improvement). Kerangka kerja ini memungkinkan agen LLM menulis ulang harness-nya sendiri—termasuk prompt, alat, memori, alur kontrol, dan sub-agen—tanpa mengubah bobot model.

  • RRSI mengatasi overfitting dengan membatasi loop peningkatan menggunakan regularizer seperti anggaran suntingan yang menurun, pencatatan kredit yang sadar bukti, dan kritikus kebocoran yang menolak logika spesifik benchmark.
  • Sistem ini menggunakan aturan dasar dan biaya yang disesuaikan dengan noise untuk memastikan bahwa keuntungan itu nyata dan efisien, memangkas komponen yang berhenti menghasilkan nilai.
  • Pada Terminal-Bench 2.1, skor naik dari 74,2% menjadi 80,2%, sementara SWE-bench Verified meningkat dari 82,0% menjadi 83,8% pada split yang diisolasi.
  • Benchmark out-of-distribution mengalami kenaikan +4,7 poin pada JobBench, +3,5 pada GDPval, dan +3,7 pada APEX-Agents.
  • Kerangka kerja ini mengurangi penggunaan token kebijakan sekitar 30-36% dibandingkan dengan metode evolusi tanpa regularisasi.

Para penulis menganggap hal ini penting karena memungkinkan agen AI meningkatkan struktur operasional mereka sendiri sambil mempertahankan generalisasi di seluruh tugas yang tidak dioptimalkan secara eksplisit.