Aiden descreve uma arquitetura para agentes que requer conversa de voz full-duplex junto com raciocínio visual complexo e ações do dispositivo, evitando a limitação de um único modelo lidando com ambos. A solução divide as responsabilidades: um modelo de voz em tempo real gerencia a conversa enquanto um modelo separado e mais forte executa tarefas em segundo plano, coordenando-se assincronamente por meio de uma fila de tarefas.

As decisões de design-chave incluem rastrear a conclusão e o sucesso da tarefa como sinais distintos para evitar que a camada de conversação adivinhe os resultados do backend. Os resultados que chegam ao primeiro plano passam por uma fila com uma janela de agregação de 500 ms para mesclar saídas concorrentes. As tarefas do dispositivo são executadas estritamente em série para evitar ambiguidade, e eventos de tempo de execução são convertidos em objetos UserMessage padrão para evitar reescritas frequentes do prompt do sistema.

O autor observa que esta é uma implementação na fase de dev-board e busca feedback sobre o manuseio de interrupções quando chega nova entrada de voz enquanto o backend está no meio da tarefa.