أطلق فريق من أبحاث الذكاء الاصطناعي في جوجل كلاود، وجامعة واشنطن في سانت لويس، وجامعة كارولاينا الشمالية في تشابل هيل، أداة EnvHarness، وهي طبقة قابلة للبرمجة تحول معايير الوكلاء الثابتة إلى عوالم تدريب تكيفية. يلتف النظام حول البيئات الموجودة باستخدام مكونات قابلة للإلحاق تعمل حصرياً من خلال واجهة reset() وstep() القياسية، مما يسمح للبيئة بالتكيف مع تدريب السياسة دون تغيير المحاكي الأساسي أو المُحققات التي بناها البشر.

  • يستخدم EnvHarness مصمم LLM يُسمى EnvRigger لتشخيص عيوب مسارات تنفيذ السياسة وكتابة غلافات مستهدفة تلقائياً.
  • يتضمن النظام ثلاثة مكونات قابلة للتكوين: Stage (يعيد كتابة حالات البداية)، Contract (يثبت خطافات لكل خطوة على الإجراءات والملاحظات)، وChain (يؤلف بيئات ثانية ضمن ميزانيات مشتركة).
  • عبر خمسة معايير تشمل ALFWorld، WebArena، SWE-bench Verified، OfficeQA، وSpreadsheetBench، اكتسبت المهارات المستخرجة عبر EnvHarness ما يصل إلى 9.0 نقاط في المهام المحجوزة للتقييم.
  • على SWE-bench Verified، قلل النهج متوسط خطوات التنفيذ بنسبة 9.8% بينما زاد معدلات الحل من 49.88 إلى 52.58.
  • الكود متاح كـ Apache-2.0 بلغة Python، ويتطلب فقط بيئة قابلة لإعادة التعيين ودورة تقييم وكيل موجودة.

يرى المؤلفون أن هذا مهم لأن البيئات الثابتة تتوقف عن التعليم بمجرد حلها، بينما يسمح EnvHarness للوكلاء بالاستمرار في التعلم من خلال استهداف نقاط الضعف المحددة أثناء التدريب.