スペインでRetell AI、Ollama、およびRTX 4000 Ada上のローカルモデルを使用して2つの本番環境音声エージェントを実行しているチームは、会話品質が向上したものの、根本的なレイテンシの問題は未解決であると報告しています。主な制約はRetell AIからの約3秒のタイムアウトです;LLMがこの時間内に最初のトークンを生成できない場合、接続が切断され、2回の再接続後に通話が終了します。
- コンテキスト長が増加すると最初のトークンまでのレイテンシも増加します:llama3.1:8bの場合、初期ターンでは0.8〜1.5秒だった時間が、プロンプトが2048トークンのコンテキスト制限に近づくとターン7以降で2.7〜4.9秒に上昇しました。
- 同時WebSocket接続とRAG埋め込みはGPUリソースを競合し、40msのオーバーヘッドを追加します。これはGPUがビジー状態の場合300〜700msまで跳ね上がることがあります。
- 小規模モデルは構造化出力に苦戦しており、正しいチケットマーカーを生成するのは60%のケースのみです。これはストリーミング中断や幻覚的なコンテキストによるものです。
- コンテキストウィンドウの計算により、制限に達する前に応答生成に残されるトークンは約604トークンしかありません。これにより、Ollamaでは古い会話履歴が静かに切り捨てられます。
著者らはこれらの知見が重要だと考えています。なぜなら、コンシューマーグレードのハードウェアでのローカル推論は、高い失敗率を受け入れるかホスト型モデルに移行することなく、複雑なRAGと構造化出力要件を持つリアルタイム音声エージェントをまだ信頼性を持ってサポートできないことを浮き彫りにしているからです。