Aiden menggambarkan arsitektur untuk agen yang memerlukan percakapan suara full-duplex bersama dengan penalaran visual kompleks dan tindakan perangkat, menghindari keterbatasan satu model yang menangani keduanya. Solusi membagi tanggung jawab: model suara real-time mengelola percakapan sementara model terpisah yang lebih kuat mengeksekusi tugas latar belakang, berkoordinasi secara asinkron melalui antrian tugas.

Keputusan desain kunci meliputi pelacakan penyelesaian dan keberhasilan tugas sebagai sinyal terpisah untuk mencegah lapisan percakasan menebak hasil backend. Hasil yang mencapai foreground melewati antrian dengan jendela agregasi 500 ms untuk menggabungkan output konkuren. Tugas perangkat dieksekusi secara ketat berurutan untuk menghindari ambiguitas, dan peristiwa runtime dikonversi ke objek UserMessage standar untuk menghindari penulisan ulang prompt sistem yang sering.

Penulis mencatat ini adalah implementasi tahap dev-board dan mencari umpan balik tentang penanganan interupsi ketika input suara baru tiba sementara backend sedang di tengah tugas.