एक इंजीनियर उन आर्किटेक्चर और विफलता मोड का विवरण देता है जो प्रोजेक्ट्स को साधारण चैटबॉट्स से योजना, टूल उपयोग और मल्टी-स्टेप टास्क पूरा करने में सक्षम मजबूत एजेंटिक सिस्टम में स्थानांतरित करते समय सामने आए।

  • एजेंट लूप में एक तर्क कोर (LLM), एक कठोर टूल इंटरफेस परत, स्टेट मशीन के माध्यम से निर्धारक योजना, और संदर्भ, इपिसोडिक डेटा और दीर्घकालिक स्थिति के लिए अलग-अलग मेमोरी प्रकार शामिल हैं।
  • टूल इंटरफेस को कठोर स्कीमा, इनपुट सत्यापन, टाइमआउट, और रीट्राई फ्लैग के साथ संरचित त्रुटि प्रारूप की आवश्यकता होती है ताकि कच्चे स्टैक ट्रेस से होने वाले अनंत लूप को रोका जा सके।
  • मूल्यांकन में एकल-टर्न मेट्रिक्स के बजाय ट्रैजेक्टरी विश्वसनीयता पर ध्यान केंद्रित करना चाहिए; पांच चरणों में प्रति-चरण 90% विश्वसनीयता वाली एक टास्क का परिणाम केवल ~59% एंड-टू-एंड सफलता होता है।
  • प्रभावी उत्पादन एजेंट निर्धारक गार्डरेल, मॉडल कॉल की पूर्ण इंस्ट्रुमेंटेशन, और केवल प्रॉम्प्ट इंजीनियरिंग के बजाय अपरिवर्तनीय कार्यों के लिए ह्यूमन-इन-द-लूप अनुमोदन गेट पर निर्भर करते हैं।

लेखक पर जोर देते हैं कि विश्वसनीय एजेंट तैनाती कठोर सत्यापन परतों, संरचित त्रुटि प्रबंधन और चेन्ड ऑपरेशंस में निहित बढ़ती विफलता दरों को प्रबंधित करने के लिए यथार्थवादी मल्टी-स्टेप मूल्यांकन पर निर्भर करती है।