ThunderAgent एक सिस्टम है जो उच्च-कन्करेंसी संश्लेषित डेटा जनरेशन में KV कैश थ्रैशिंग को दूर करने के लिए एजेंटिक LLM अनुरोध शेड्यूलिंग के लिए एक प्रोग्राम अमूर्तता पेश करता है। एजेंट वर्कफ़्लो को स्वतंत्र अनुरोधों के बजाय शेड्यूल करने योग्य प्रोग्राम मानकर, यह थ्रूपुट को काफी बढ़ाता है और लेटेंसी को कम करता है।
- डिफ़ॉल्ट SGLang शेड्यूलर्स की तुलना में उच्च कन्करेंसी पर 2.5× तक अधिक सिंगल-नोड थ्रूपुट और 10× कम P50 लेटेंसी हासिल करता है।
- 16 से 64 GPUs तक नियर-लाइनियर थ्रूपुट स्केलिंग के साथ 8-नोड क्लस्टर पर 2.4× की स्पीडअप प्रदान करता है।
- लोड बैलेंसिंग के लिए प्रोग्राम-स्तर एडमिशन कंट्रोल और एक ग्लोबल वेटिंग क्यू के माध्यम से KV कैश थ्रैशिंग को कम करता है।
- OpenAI-कम्पैटिबल एंडपॉइंट्स के माध्यम से HiCache और स्पेकुलेटिव डिकोडिंग जैसे मौजूदा ऑफलोडिंग रणनीतियों के साथ संगत है।
सिस्टम उपयोगकर्ताओं को अपने अंतर्निहित इनफरेंस बैकएंड में बदलाव किए बिना एजेंटिक इनफरेंस ऑप्टिमाइज़ेशन अपनाने की अनुमति देता है, जिससे बड़े-स्तर के एजेंट ट्रेनिंग पाइपलाइन के लिए व्यावहारिक स्केलेबिलिटी प्रदान होती है।