Aidenは、複雑な視覚推論とデバイス操作を伴うフルデュプレックスの音声会話が必要で、両方を処理する単一モデルの制限を回避するエージェント向けのアーキテクチャを説明しています。この解決策は責任を分割します:リアルタイム音声モデルが会話を管理し、別個のより強力なモデルがバックグラウンドタスクを実行し、タスクキューを通じて非同期に調整します。
主要な設計上の決定には、会話層がバックエンドの結果を推測しないようにするために、タスク完了と成功を別のシグナルとして追跡することが含まれます。フォアグラウンドに到達する結果は、同時出力をマージするための500msの集約ウィンドウを持つキューを通過します。デバイスタスクは曖昧さを避けるために厳密に逐次実行され、ランタイムイベントはシステムプロンプトの頻繁な書き換えを避けるために標準的なUserMessageオブジェクトに変換されます。
著者はこれはdev-board段階の実装であり、バックエンドがタスクの最中に新しい音声入力が入力されたときの割り込み処理に関するフィードバックを求めていると述べています。