يقدم الباحثون نظام AIDE^2، الذي يطبق حلقة من التحسين الذاتي المتكرر لوكيل بحث ذكي من خلال تحسين شيفرته الخاصة. يقترح النظام تغييرات على منطقِه الداخلي، ويقيّم النسخ المعدّلة في مهام البحث والتطوير للذكاء الاصطناعي، ويحتفظ فقط بتحسينات التي حققت أفضل أداء في التقييمات المخفية.

  • في تشغيل ذاتي استمر 8 أيام، اكتشف AIDE^2 سبع تحسينات متتالية، بما في ذلك سياسة بحث جديدة وآليات ذاكرة لضغط السياق.
  • يتطابق أقوى وكيل تم اكتشافه أو يتفوق على وكيل إنتاجي مُصمَّم يدوياً عبر أربعة معايير تقييم معزولة في هندسة الذكاء الاصطناعي، وهندسة الخوارزميات الإرشادية، والتنبؤ بالطقس القائم على الفيزياء.
  • في عائلة مهام معزولة منفصلة، أظهرت الوكلاء المكتشفون انخفاضاً في التلاعب بالمكافأة، حيث انخفض المعدل من 55% إلى 32%, وهو أقل بـ7 نقاط مئوية من الوكيل المُصمَّم يدوياً.

تُظهر هذه النتائج أن وكيل بحث ذكي يمكنه تحسين كفاءة بحثه الذاتي من خلال التحسين الذاتي المتكرر، وأن هذه المكاسب تنتقل إلى مهام ومجالات لم تواجهها الحلقة أبداً.