Um desenvolvedor de IA está pedindo conselhos de arquitetura para construir um sistema de IA de voz em tempo real que atinja aproximadamente 500 ms ou menos de latência de primeiro token, mantendo-se economicamente viável e escalável.

A solicitação abrange escolhas de componentes em toda a pipeline, incluindo protocolos de transporte de áudio como WebRTC, Detecção de Atividade de Voz, provedores de Fala-para-Texto como Deepgram e AssemblyAI, LLMs como Gemini Live e OpenAI Realtime, serviços de Texto-para-Fala e frameworks de orquestração. O desenvolvedor solicita especificamente insights de nível de produção sobre quais componentes mais contribuem para a latência, se modelos fala-para-fala superam as pipelines tradicionais STT-LLM-TTS e quais provedores oferecem o melhor equilíbrio entre latência, qualidade e custo.

O autor solicita números do mundo real, benchmarks e lições aprendidas de implantações em produção para ajudar a identificar erros arquitetônicos comuns que aumentam a latência.