Aiden 描述了一种代理架构,该架构需要全双工语音对话以及复杂的视觉推理和设备操作,避免了单一模型同时处理这两者的限制。该解决方案划分了职责:实时语音模型管理对话,而一个单独的、更强的模型执行后台任务,通过任务队列异步协调。
关键设计决策包括将任务完成和成功作为不同的信号进行跟踪,以防止对话层猜测后端结果。到达前台的结果通过一个具有 500ms 聚合窗口的队列,以合并并发输出。设备任务严格按顺序执行以避免歧义,运行时事件被转换为标准的 UserMessage 对象,以避免频繁重写系统提示。
作者指出这是 dev-board 阶段的实现,并寻求关于当后端正在处理任务时收到新语音输入的打断处理的反馈。