Aiden décrit une architecture pour les agents qui nécessite une conversation vocale full-duplex ainsi qu'un raisonnement visuel complexe et des actions sur le dispositif, évitant ainsi la limitation d'un modèle unique gérant les deux. La solution divise les responsabilités : un modèle de voix en temps réel gère la conversation tandis qu'un modèle séparé et plus puissant exécute les tâches en arrière-plan, en se coordonnant de manière asynchrone via une file d'attente de tâches.

Les décisions de conception clés incluent le suivi de l'achèvement et du succès de la tâche comme des signaux distincts pour empêcher la couche conversationnelle de deviner les résultats du backend. Les résultats atteignant le premier plan passent par une file d'attente avec une fenêtre d'agrégation de 500 ms pour fusionner les sorties concurrentes. Les tâches du dispositif sont exécutées strictement en série pour éviter l'ambiguïté, et les événements d'exécution sont convertis en objets UserMessage standard pour éviter les réécritures fréquentes du prompt système.

L'auteur note qu'il s'agit d'une implémentation au stade dev-board et cherche des commentaires sur la gestion des interruptions lorsque de nouvelles entrées vocales arrivent pendant que le backend est en cours de tâche.