Un desarrollador de IA está solicitando asesoramiento arquitectónico para construir un sistema de IA de voz en tiempo real que logre una latencia del primer token de aproximadamente 500 ms o menos, manteniéndose a la vez rentable y escalable.

La solicitud cubre las elecciones de componentes a lo largo de toda la canalización, incluidos protocolos de transporte de audio como WebRTC, Detección de Actividad de Voz, proveedores de voz a texto como Deepgram y AssemblyAI, LLMs como Gemini Live y OpenAI Realtime, servicios de texto a voz y marcos de orquestación. El desarrollador solicita específicamente conocimientos de nivel de producción sobre qué componentes contribuyen más a la latencia, si los modelos de voz a voz superan a las canalizaciones tradicionales STT-LLM-TTS y qué proveedores ofrecen el mejor equilibrio entre latencia, calidad y costo.

El autor solicita números del mundo real, puntos de referencia y lecciones aprendidas de implementaciones en producción para ayudar a identificar errores arquitectónicos comunes que aumentan la latencia.