Google Cloud AI Researchは、UNCチャペルヒル校、スタンフォード大学、ワシントン大学セントルイス校と共同で、RRSI(Regularized Recursive Self-Improvement)をオープンソース化した。このフレームワークにより、LLMエージェントはモデルの重みを変更せずに、プロンプト、ツール、メモリ、制御フロー、サブエージェントを含む自身のハーネスを書き換えることができる。

  • RRSIは、減衰エディット予算、証拠認識型クレジットロギング、ベンチマーク固有のロジックを拒否するリーケージクリティックなどの正則化子によって改善ループを制約することで、過学習に対処する。
  • システムはノイズ調整された下限とコストルールを使用し、利益が実効的で効率的であることを保証し、価値を生み出さなくなったコンポーネントをプルーニングする。
  • Terminal-Bench 2.1ではスコアが74.2%から80.2%に上昇し、SWE-bench Verifiedでもホールドアウトスプリットで82.0%から83.8%に改善した。
  • 分布外ベンチマークでは、JobBenchで+4.7ポイント、GDPvalで+3.5、APEX-Agentsで+3.7の向上が見られた。
  • このフレームワークは、正則化されていない進化手法と比較して、ポリシートークンの使用量を約30-36%削減する。

著者らはこれを重要視している。なぜなら、明示的に最適化されたタスクに対して一般化を維持しつつ、AIエージェントが自身の運用構造を改善できるからだ。