あるAI開発者は、約500ms以下の初回トークンレイテンシを達成しつつ、コスト効率とスケーラビリティを維持するリアルタイム音声AIシステムを構築するためのアーキテクチャに関する助言を求めている。

このリクエストには、WebRTCのようなオーディオ転送プロトコル、音声活動検出(VAD)、DeepgramやAssemblyAIなどのSpeech-to-Textプロバイダ、Gemini LiveやOpenAI RealtimeのようなLLM、Text-to-Speechサービス、そしてオーケストレーションフレームワークなど、パイプライン全体にわたるコンポーネントの選択が含まれている。開発者は特に、どのコンポーネントがレイテンシに最も寄与しているか、従来のSTT-LLM-TTSパイプラインと比較してspeech-to-speechモデルがより高いパフォーマンスを発揮するかどうか、そしてレイテンシ、品質、コストのバランスが最も優れているプロバイダはどれかについて、本番環境での知見を求めている。

著者は、レイテンシを増加させる一般的なアーキテクチャ上のミスを特定するのに役立つ、実際の数値、ベンチマーク、および本番デプロイメントからの教訓を求めている。