Разработчик ИИ просит архитектурных рекомендаций для создания системы голосового ИИ в реальном времени, обеспечивающей задержку первого токена примерно 500 мс или менее, оставаясь при этом экономичной и масштабируемой.
Запрос охватывает выбор компонентов во всём конвейере, включая протоколы передачи аудио, такие как WebRTC, обнаружение активности голоса (VAD), провайдеров преобразования речи в текст, таких как Deepgram и AssemblyAI, LLM, таких как Gemini Live и OpenAI Realtime, сервисы преобразования текста в речь и фреймворки оркестрации. Разработчик конкретно просит производственные рекомендации о том, какие компоненты вносят наибольший вклад в задержку, превосходят ли модели «речь-в-речь» традиционные конвейеры STT-LLM-TTS и какие провайдеры предлагают наилучший баланс между задержкой, качеством и стоимостью.
Автор просит реальные цифры, бенчмарки и выводы из производственных развертываний, чтобы помочь выявить распространённые архитектурные ошибки, увеличивающие задержку.