शोधकर्ताओं ने APEx का प्रस्ताव दिया है, जो एक पदानुक्रमित अनुभव उपयोग ढांचा है जो इंटरैक्शन इतिहास को उदाहरण-स्तर ट्रैजेक्टरी मेमोरी और श्रेणी-स्तर प्रक्रियात्मक कौशल में संगठित करता है ताकि गहन शोध एजेंटों को बेहतर बनाया जा सके।
- सिस्टम इन मेमोरी को Executor, Distiller, और Planner मॉड्यूल से मिलकर बंद-लूप आर्किटेक्चर के माध्यम से जोड़ता है।
- इन मॉड्यूलों को पुरस्कार-निर्देशित कौशल संक्षेपण के लिए तीन-चरण की वैकल्पिक GRPO प्रशिक्षण पैराडाइम के माध्यम से अनुकूलित किया जाता है।
- परीक्षण समय पर, संक्षिप्त कौशल ऑनलाइन Planner अनुकूलन के लिए प्रक्रियात्मक पूर्व ज्ञान के रूप में कार्य करते हैं, जिसमें कौशल-निर्देशित टेस्ट-टाइम रीइन्फोर्समेंट लर्निंग का उपयोग किया जाता है।
- 7 बेंचमार्क्स पर प्रयोगों से पता चलता है कि APEx GPT-5.4 से 14.7 अंक और सबसे मजबूत मेमोरी-संवर्धित आधार रेखा से 3.0 अंक आगे है।
APEx ground-truth-मुक्त स्वयं-उन्नति को सक्षम बनाता है, कौशल-अलाइनमेंट नियमितकरण के साथ पॉलिसी ड्रिफ्ट को रोकता है, और जटिल प्रश्नों पर सर्वश्रेष्ठ प्रदर्शन प्राप्त करता है।