Uma equipe que executa dois agentes de voz em produção na Espanha usando Retell AI, Ollama e modelos locais em uma RTX 4000 Ada relata que, embora a qualidade da conversa tenha melhorado, o problema central de latência permanece sem solução. A principal restrição é um tempo limite de ~3 segundos do Retell AI; se o LLM não conseguir produzir um primeiro token dentro dessa janela, a conexão cai, levando ao encerramento da chamada após duas reconexões.
- A latência do primeiro token aumenta com o comprimento do contexto: para llama3.1:8b, os tempos subiram de 0,8–1,5s nas primeiras rodadas para 2,7–4,9s na rodada 7+ à medida que o prompt se aproximava do limite de contexto de 2048 tokens.
- Conexões WebSocket simultâneas e incorporações RAG competem por computação da GPU, adicionando 40ms de sobrecarga que podem disparar para 300–700ms se a GPU estiver ocupada.
- O modelo pequeno tem dificuldades com saída estruturada, gerando marcadores de ticket corretos apenas 60% das vezes, frequentemente devido a interrupções de streaming ou contexto alucinado.
- A matemática da janela de contexto deixa apenas ~604 tokens para geração de resposta antes de atingir os limites, causando truncamento silencioso do histórico de conversas mais antigas no Ollama.
Os autores consideram esses achados significativos porque destacam que a inferência local em hardware de nível consumidor ainda não pode apoiar confiavelmente agentes de voz em tempo real com requisitos complexos de RAG e saída estruturada sem aceitar altas taxas de falha ou migrar para modelos hospedados.