स्पेन में Retell AI, Ollama और RTX 4000 Ada पर स्थानीय मॉडल्स का उपयोग करके दो उत्पादन वॉइस एजेंट्स चला रही एक टीम ने रिपोर्ट की है कि जबकि संवाद की गुणवत्ता में सुधार हुआ है, लेकिन मुख्य लेटेंसी समस्या अभी भी हल नहीं हुई है। प्राथमिक बाधा Retell AI से लगभग 3-सेकंड का टाइमआउट है; यदि LLM इस विंडो के भीतर पहला टोकन उत्पन्न करने में विफल रहता है, तो कनेक्शन टूट जाता है, जिसके परिणामस्वरूप दो पुनः कनेक्शन के बाद कॉल समाप्त हो जाती है।
- संदर्भ लंबाई के साथ पहला टोकन लेटेंसी बढ़ता है: llama3.1:8b के लिए, समय शुरुआती चरणों में 0.8–1.5s से बढ़कर 7+ वार्ता तक 2.7–4.9s हो गया क्योंकि प्रॉम्प्ट 2048-टोकन संदर्भ सीमा के करीब पहुंच गया।
- समवर्ती WebSocket कनेक्शन और RAG एम्बेडिंग GPU कंप्यूट के लिए प्रतिस्पर्धा करते हैं, जिससे 40ms का ओवरहेड जुड़ जाता है जो GPU व्यस्त होने पर 300–700ms तक बढ़ सकता है।
- छोटा मॉडल संरचित आउटपुट के साथ संघर्ष करता है, केवल 60% समय में सही टिकट मार्कर उत्पन्न करता है, अक्सर स्ट्रीमिंग रुकावटों या भ्रमित संदर्भ के कारण।
- संदर्भ विंडो की गणना केवल ~604 टोकन प्रतिक्रिया जनरेशन के लिए छोड़ती है, सीमाओं से पहले, जिससे Ollama में पुराने संवाद इतिहास का मौन रूप से ट्रंकेट हो जाता है।
लेखक इन निष्कर्षों को महत्वपूर्ण मानते हैं क्योंकि वे इस बात को उजागर करते हैं कि उपभोक्ता-ग्रेड हार्डवेयर पर स्थानीय इन्फरेंस अभी तक वास्तविक समय के वॉइस एजेंट्स को जटिल RAG और संरचित आउटपुट आवश्यकताओं के बिना विश्वसनीय रूप से सपोर्ट नहीं कर सकता, या तो उच्च विफलता दर स्वीकार करने या होस्टेड मॉडल्स पर जाने के बिना।