Un développeur d'IA sollicite des conseils architecturaux pour construire un système d'IA vocale en temps réel atteignant une latence du premier jeton d'environ 500 ms ou moins, tout en restant rentable et évolutif.

La demande couvre les choix de composants à travers l'ensemble du pipeline, y compris les protocoles de transport audio comme WebRTC, la détection d'activité vocale, les fournisseurs de parole-en-texte tels que Deepgram et AssemblyAI, les LLMs comme Gemini Live et OpenAI Realtime, les services de texte-en-parole, et les frameworks d'orchestration. Le développeur demande spécifiquement des informations de niveau production sur quels composants contribuent le plus à la latence, si les modèles parole-en-parole surpassent les pipelines traditionnels STT-LLM-TTS, et quels fournisseurs offrent le meilleur équilibre entre latence, qualité et coût.

L'auteur demande des chiffres réels, des benchmarks et les enseignements tirés des déploiements en production pour aider à identifier les erreurs architecturales courantes qui augmentent la latence.