Aiden describe una arquitectura para agentes que requiere conversación de voz full-duplex junto con razonamiento visual complejo y acciones del dispositivo, evitando la limitación de un único modelo que maneje ambas cosas. La solución divide las responsabilidades: un modelo de voz en tiempo real gestiona la conversación mientras un modelo separado y más potente ejecuta tareas en segundo plano, coordinándose asíncronamente a través de una cola de tareas.

Las decisiones de diseño clave incluyen rastrear la finalización y el éxito de la tarea como señales distintas para evitar que la capa conversacional adivine los resultados del backend. Los resultados que llegan al primer plano pasan por una cola con una ventana de agregación de 500 ms para fusionar salidas concurrentes. Las tareas del dispositivo se ejecutan estrictamente en serie para evitar ambigüedades, y los eventos de tiempo de ejecución se convierten en objetos UserMessage estándar para evitar reescrituras frecuentes del prompt del sistema.

El autor señala que esta es una implementación en etapa de dev-board y busca comentarios sobre el manejo de interrupciones cuando llega nueva entrada de voz mientras el backend está a mitad de tarea.