أفاد فريق يعمل على وكيلين صوتيين للإنتاج في إسبانيا باستخدام Retell AI و Ollama ونماذج محلية على بطاقة RTX 4000 Ada بأن جودة المحادثة تحسنت، لكن مشكلة التأخير الأساسية لا تزال غير محلولة. القيد الرئيسي هو مهلة زمنية تبلغ حوالي 3 ثوانٍ من Retell AI؛ إذا فشل النموذج اللغوي في إنتاج الرمز الأول ضمن هذه الفترة، ينقطع الاتصال، مما يؤدي إلى إنهاء المكالمة بعد إعادة اتصالين.
- يزداد تأخير الرمز الأول مع طول السياق: بالنسبة لـ llama3.1:8b، ارتفعت الأوقات من 0.8–1.5 ثانية في الأدوار الأولى إلى 2.7–4.9 ثانية بحلول الدور 7+ عندما اقترب النص التوجيهي من حد سياق الـ 2048 رمزاً.
- تتنافس الاتصالات المتزامنة عبر WebSocket وتضمينات RAG على موارد الحوسبة للوحدة الرسومية، مما يضيف عبئاً قدره 40 مللي ثانية يمكن أن يرتفع إلى 300–700 مللي ثانية إذا كانت الوحدة الرسومية مشغولة.
- يعاني النموذج الصغير من المخرجات المهيكلة، حيث ينتج علامات التذكرة الصحيحة بنسبة 60% فقط من الوقت، غالباً بسبب انقطاعات البث أو السياق المتوهّم.
- تترك حسابات نافذة السياق حوالي 604 رمزاً فقط لتوليد الاستجابة قبل الوصول إلى الحدود، مما يسبب قطعاً صامتاً لسجل المحادثة الأقدم في Ollama.
يرى المؤلفون أن هذه النتائج مهمة لأنها تسلط الضوء على أن الاستدلال المحلي على عتاد المستهلك لا يزال غير قادر على دعم وكلاء الصوت الفوريين الذين يتطلبون RAG معقداً ومخرجات مهيكلة بشكل موثوق، دون إما قبول معدلات فشل عالية أو الانتقال إلى نماذج مستضافة.