一个在西班牙运营两个生产级语音助手的团队,使用 Retell AI、Ollama 以及 RTX 4000 Ada 上的本地模型进行部署。该团队报告称,虽然对话质量有所提升,但核心延迟问题仍未得到解决。主要约束来自 Retell AI 的约 3 秒超时限制;如果大语言模型未能在此窗口内生成首个 token,连接将会断开,导致在两次重连后通话终止。

  • 首 token 延迟随上下文长度增加而上升:对于 llama3.1:8b,早期轮次的延迟从 0.8–1.5 秒增加到第 7 轮及之后的 2.7–4.9 秒,此时提示词已接近 2048-token 的上下文限制。
  • 并发的 WebSocket 连接和 RAG 嵌入争夺 GPU 计算资源,增加了 40ms 的开销;如果 GPU 繁忙,该开销可能飙升至 300–700ms。
  • 小模型在处理结构化输出时表现挣扎,仅能正确生成工单标记 60% 的时间,这通常是由于流式传输中断或幻觉上下文所致。
  • 上下文窗口的数学计算导致在触及限制前,仅剩约 604 个 token 用于响应生成,从而在 Ollama 中导致旧对话历史的静默截断。

作者认为这些发现具有重要意义,因为它们表明,在消费级硬件上进行本地推理目前尚无法可靠地支持具有复杂 RAG 和结构化输出需求的实时语音助手,除非接受高失败率或转向托管模型。