Aiden एजेंट्स के लिए एक आर्किटेक्चर का वर्णन करता है जिसमें जटिल दृश्य तर्क और डिवाइस कार्यों के साथ पूर्ण-डुप्लेक्स आवाज़ संवाद की आवश्यकता होती है, दोनों को संभालने वाले एकल मॉडल की सीमा से बचते हुए। समाधान जिम्मेदारियों को विभाजित करता है: एक वास्तविक समय आवाज़ मॉडल संवाद का प्रबंधन करता है जबकि एक अलग, शक्तिशाली मॉडल पृष्ठभूमि कार्यों को निष्पादित करता है, कार्य कतार के माध्यम से असिंक्रोनस रूप से समन्वयित।

मुख्य डिज़ाइन निर्णयों में कार्य पूर्णता और सफलता को अलग-अलग संकेतों के रूप में ट्रैक करना शामिल है ताकि संवाद परत बैकएंड परिणामों की अनुमान न लगा सके। फोरग्राउंड तक पहुंचने वाले परिणाम एक कतार से गुजरते हैं जिसमें 500ms का एग्रीगेशन विंडो होता है ताकि समवर्ती आउटपुट को मर्ज किया जा सके। डिवाइस कार्यों को स्पष्टता से बचने के लिए कड़ाई से क्रमिक रूप से निष्पादित किया जाता है, और रनटाइम इवेंट्स को अक्सर सिस्टम प्रॉम्पट पुनर्लेखन से बचने के लिए मानक UserMessage ऑब्जेक्ट में परिवर्तित किया जाता है।

लेखक नोट करते हैं कि यह एक dev-board चरण कार्यान्वयन है और वे तब जब बैकएंड कार्य के बीच में होता है तो नई आवाज़ इनपुट आने पर इंटरप्शन हैंडलिंग पर प्रतिक्रिया चाहते हैं।