著者は、エージェントがモデルパラメータを更新するのではなく、実行指向のハーネスを進化させることで改善するパラダイムである Harness Continual Learning (HCL) を導入します。このアプローチは、プロンプト、メモリ、ルーティングルールなどのコンポーネントを通じて新しい経験に適応しながら、以前に習得した行動を保持するという課題に対処します。
- HCL は4つのコンポーネントを利用します:Task Interface、Experience Memory、Capability Map、および Adaptive Router。
- Guarded harness evolution は、Continual Optimizer と Evaluator を使用して、更新生成と状態のコミットメントを分離します。
- 実験では、テキスト推論、マルチモーダル知覚、オープンワールドインタラクションにおいて、ベースラインに対して相対的に10%以上の向上が見られました。
- 制御された保持スキャンにより、ハーネスレベルでの測定可能な忘却が明らかになり、安定性と可塑性のトレードオフを明示的に調整することが可能になります。
この手法は、基盤モデルをフリーズさせたままにすることで、以前に習得した行動を妨げることなく、能力の蓄積と障害からの回復を可能にします。