Para penulis memperkenalkan Growing Harness, sebuah paradigma pelatihan yang mempelajari struktur kontrol agen dari umpan balik tugas, bukan mengandalkan harness standar yang bergantung pada konteks. Dengan mengonversi keputusan kontrol berulang menjadi kode yang dapat dieksekusi dan membatasi panggilan LLM untuk penalaran semantik, metode ini bertujuan menciptakan agen spesialis yang dapat digunakan kembali.
- Growing Harness menggunakan kerangka kerja tanpa strategi dengan antarmuka tetap, melokalisasi kegagalan melalui jejak eksekusi tingkat fungsi.
- Sebuah optimizer memperbaiki jendela kegagalan secara bersamaan, sementara gerbang sukses-first membatalkan pengeditan yang merusak kemampuan sebelumnya.
- Di BrowseComp-Plus dan WebArena-Verified dengan model dari 4B hingga 120B parameter, metode ini mencapai rata-rata keberhasilan tertinggi dalam lima dari enam pengaturan.
- Metode ini mengurangi panggilan LLM sebesar 76.0-91.8% dan biaya inferensi agen yang di-deploy sebesar 74.4-98.6% dibandingkan dengan agen Tool-Calling.
- Pada WebArena-Verified, keberhasilan tetap stabil di 44.7-45.3% melintasi skala model, sedangkan Tool-Calling turun menjadi 6.7% dengan model 4B.
Pertumbuhan program yang persisten memindahkan kontrol berulang dari konteks model ke kode berbiaya rendah, memungkinkan agen tetap efektif bahkan saat di-deploy dengan model yang lebih kecil.