يُعد ThunderAgent نظامًا يقدم تجريدًا للبرنامج لجدولة طلبات نماذج اللغة الكبيرة الوكيلية لمعالجة ظاهرة التصادم المتكرر في ذاكرة التخزين المؤقت للكلمات (KV cache) أثناء توليد البيانات الاصطناعية ذات الحمل العالي. ومن خلال معالجة سير عمل الوكلاء كبرامج قابلة للجدولة بدلاً من طلبات مستقلة، فإنه يحسن الإنتاجية بشكل كبير ويقلل زمن الاستجابة.

  • يحقق إنتاجية أعلى على عقدة واحدة بمقدار 2.5× وزمن استجابة P50 أقل بمقدار 10 مرات عند الحمل العالي مقارنةً بمجدولات SGLang الافتراضية.
  • يوفر تسريعًا بمقدار 2.4× على مجموعة مكونة من 8 عقد مع توسع خطي شبه تام للإنتاجية من 16 إلى 64 وحدة معالجة رسومية (GPU).
  • يخفف من ظاهرة التصادم المتكرر في ذاكرة التخزين المؤقت للكلمات من خلال التحكم في القبول على مستوى البرنامج وطابور انتظار عالمي لتوازن الحمل.
  • متوافق مع استراتيجيات الإخراج الحالية مثل HiCache والاستنتاج التكهنى عبر نقاط نهاية متوافقة مع واجهة برمجة تطبيقات OpenAI.

يتيح النظام للمستخدمين اعتماد تحسينات الاستدلال الوكيل دون تغيير الخلفية الأساسية للاستدلال، مما يوفر قابلية توسع عملية لخطوط تدريب الوكلاء واسعة النطاق.