يقدم الباحثون نظام AIDE^2، الذي يطبق حلقة من التحسين الذاتي المتكرر لوكيل أبحاث ذكاء اصطناعي متقدم من خلال تحسين شيفرته الخاصة. يقترح النظام تغييرات على منطقِه الداخلي، ويقيّم الإصدارات المعدّلة في مهام بحث وتطوير الذكاء الاصطناعي، ويحتفظ فقط بتلك التحديثات التي تحقق أفضل أداء في التقييمات المخفية.
- في تشغيل ذاتي دام 8 أيام، اكتشف AIDE^2 سبع تحسينات متتالية، بما في ذلك سياسات بحث جديدة وآليات ذاكرة لضغط السياق.
- تعمّمت هذه المكاسب على أربعة معايير معزولة تغطي هندسة تعلم الآلة، وهندسة الخوارزميات الإرشادية، والتنبؤ بالطقس القائم على الفيزياء.
- على جميع المعايير الأربعة، وافق أقوى وكيل تم اكتشافه أو تجاوز أداء وكيل بحث إنتاجي مصمم بشريًا، والذي يصنف ضمن الأقوى على FML-Bench.
- في عائلة مهام معزولة منفصلة، أظهرت الوكلاء المكتشفون انخفاضًا في التلاعب بالمكافأة، حيث انخفض المعدل من 55% إلى 32%, وهو أقل سبع نقاط مئوية من الوكيل المصمم بشريًا.
تُظهر هذه النتائج أن وكيل أبحاث الذكاء الاصطناعي يمكنه تحسين كفاءة بحثه الذاتي من خلال التحسين الذاتي المتكرر، وأن هذه المكاسب تنتقل إلى مهام ومجالات لم تواجهها الحلقة مطلقًا.