Команда, использующая два производственных голосовых агента в Испании на базе Retell AI, Ollama и локальных моделей на RTX 4000 Ada, сообщает, что, несмотря на улучшение качества разговора, основная проблема задержки остаётся нерешённой. Главный ограничивающий фактор — тайм-аут ~3 секунды в Retell AI; если LLM не успевает сгенерировать первый токен в это окно, соединение разрывается, что после двух переподключений приводит к завершению вызова.

  • Задержка первого токена растёт с увеличением длины контекста: для llama3.1:8b время увеличилось с 0.8–1.5с на ранних репликах до 2.7–4.9с к 7+ реплике по мере приближения промпта к лимиту контекста в 2048 токенов.
  • Одновременные WebSocket-подключения и RAG-эмбеддинги конкурируют за вычислительные ресурсы GPU, добавляя 40мс накладных расходов, которые могут возрастать до 300–700мс при загруженном GPU.
  • Маленькая модель испытывает трудности со структурированным выводом, генерируя корректные маркеры тикетов лишь в 60% случаев, часто из-за прерываний потоковой передачи или галлюцинированного контекста.
  • Математика окна контекста оставляет лишь ~604 токена для генерации ответа до достижения лимитов, что вызывает молчаливое усечение более ранней истории разговора в Ollama.

Авторы считают эти выводы значимыми, поскольку они показывают, что локальный инференс на потребительском оборудовании пока не может надёжно поддерживать голосовых агентов реального времени со сложными требованиями к RAG и структурированному выводу без либо принятия высоких показателей отказов, либо перехода на хостинговые модели.