Tim dari Google Cloud AI Research, Washington University di St. Louis, dan UNC Chapel Hill telah merilis EnvHarness, lapisan yang dapat diprogram yang mengubah benchmark agen statis menjadi dunia pelatihan adaptif. Sistem ini membungkus lingkungan yang ada menggunakan komponen plug-in yang beroperasi secara ketat melalui antarmuka reset() dan step() standar, memungkinkan lingkungan beradaptasi dengan pelatihan kebijakan tanpa mengubah simulator dasar atau verifier buatan manusia.
- EnvHarness menggunakan perancang LLM bernama EnvRigger untuk mendiagnosis kelemahan dalam rollouts kebijakan dan secara otomatis menulis pembungkus yang ditargetkan.
- Sistem ini mencakup tiga komponen yang dapat dikomposisikan: Stage (menulis ulang keadaan awal), Contract (memasang hook per-langkah pada tindakan dan pengamatan), dan Chain (mengkombinasikan lingkungan kedua di bawah anggaran bersama).
- Di lima benchmark termasuk ALFWorld, WebArena, SWE-bench Verified, OfficeQA, dan SpreadsheetBench, keterampilan yang ditambang melalui EnvHarness memperoleh peningkatan hingga 9.0 poin pada tugas yang diisolasi.
- Pada SWE-bench Verified, pendekatan ini mengurangi langkah eksekusi rata-rata sebesar 9.8% sambil meningkatkan tingkat resolusi dari 49.88 menjadi 52.58.
- Kode tersedia sebagai Python berlisensi Apache-2.0, hanya memerlukan lingkungan yang dapat di-reset dan loop evaluasi agen yang sudah ada.
Para penulis menganggap ini penting karena lingkungan statis berhenti mengajar sekali diselesaikan, sedangkan EnvHarness memungkinkan agen terus belajar dengan menargetkan kelemahan spesifik yang teridentifikasi selama pelatihan.