한 AI 개발자가 약 500ms 이하의 첫 토큰 지연 시간을 달성하면서도 비용 효율적이고 확장 가능한 실시간 음성 AI 시스템을 구축하기 위한 아키텍처 조언을 요청하고 있습니다.

이 요청은 WebRTC와 같은 오디오 전송 프로토콜, 음성 활동 감지, Deepgram 및 AssemblyAI와 같은 음성-텍스트 제공업체, Gemini Live 및 OpenAI Realtime와 같은 LLM, 텍스트-음성 서비스, 오케스트레이션 프레임워크 등 전체 파이프라인에 걸친 구성 요소 선택을 다룹니다. 개발자는 특히 지연 시간에 가장 큰 영향을 미치는 구성 요소가 무엇인지, 음성-음성 모델이 전통적인 STT-LLM-TTS 파이프라인보다 우수한지, 그리고 어떤 제공업체가 지연 시간, 품질 및 비용 간의 최적 균형을 제공하는지에 대한 프로덕션 수준의 통찰력을 구체적으로 요청합니다.

저자는 지연 시간을 증가시키는 일반적인 아키텍처 실수를 식별하는 데 도움이 되도록 실제 수치, 벤치마크 및 프로덕션 배포에서 얻은 교훈을 요청합니다.