Aiden описывает архитектуру для агентов, которая требует полнодуплексного голосового общения наряду со сложным визуальным мышлением и действиями с устройствами, избегая ограничения единой модели, обрабатывающей всё сразу. Решение разделяет обязанности: модель реального времени управляет разговором, в то время как отдельная, более мощная модель выполняет фоновые задачи, координируя их асинхронно через очередь задач.
Ключевые архитектурные решения включают отслеживание завершения и успеха задачи как отдельные сигналы, чтобы предотвратить угадывание результатов бэкенда слоем диалога. Результаты, достигающие переднего плана, проходят через очередь с окном агрегации 500 мс для объединения параллельных выводов. Задачи устройства выполняются строго последовательно для избежания неоднозначности, а события времени выполнения преобразуются в стандартные объекты UserMessage для предотвращения частых переписываний системного промпта.
Автор отмечает, что это реализация на этапе dev-board и ищет отзывы по обработке прерываний при поступлении нового голосового ввода, пока бэкенд выполняет задачу.