一位AI开发者正在寻求架构建议,以构建一个实时语音AI系统,该系统在保持成本效益和可扩展性的同时,实现大约500毫秒或更短的首字延迟。
该请求涵盖了整个管道中的组件选择,包括WebRTC等音频传输协议、语音活动检测、Deepgram和AssemblyAI等语音转文本提供商、Gemini Live和OpenAI Realtime等大语言模型、文本转语音服务以及编排框架。开发者特别询问了关于生产级见解的问题:哪些组件对延迟的贡献最大,端到端语音模型是否优于传统的STT-LLM-TTS管道,以及哪些提供商在延迟、质量和成本之间提供了最佳平衡。
作者请求提供来自生产部署的实际数据、基准测试结果和经验教训,以帮助识别导致延迟增加的常见架构错误。