Together AI ने अपने समर्पित मॉडल इनफरेंस प्लेटफ़ॉर्म की आर्किटेक्चर का विवरण दिया, जो एक क्षमता-जागरूक ट्रैफ़िक स्प्लिट के माध्यम से एंडपॉइंट्स, डिप्लॉयमेंट्स और अपरिवर्तनीय कॉन्फ़िग को जोड़ता है। यह सिस्टम स्थिर प्रतिशत के बजाय प्रभावी क्षमता (वजन गुणा तैयार रिप्लिका) के आधार पर अनुरोधों को रूट करता है, जिससे शून्य-डाउनटाइम रोलआउट और A/B टेस्टिंग जैसे फीचर्स संभव होते हैं।
- कॉन्फ़िग इंजन, GPU प्रकार और ऑप्टिमाइज़ेशन प्रोफ़ाइल (लेटेंसी, थ्रूपुट या संतुलित) निर्दिष्ट करते हैं और व्यवहार में बदलाव को रोकने के लिए अपरिवर्तनीय होते हैं।
- डिप्लॉयमेंट एक विशिष्ट मॉडल रीविजन को कॉन्फ़िग से बांधते हैं और रिप्लिका के लिए ऑटोस्केलिंग नीतियों का प्रबंधन करते हैं।
- एंडपॉइंट्स क्लाइंटों के लिए एक स्थिर पहचान प्रदान करते हैं, जो अपनी क्षमता के समानुपाती रूप से भार को डिप्लॉयमेंट्स में वितरित करने के लिए ट्रैफ़िक स्प्लिट का उपयोग करते हैं।
- प्लेटफ़ॉर्म A/B कॉहोर्ट और कैनेरी रोलआउट का समर्थन करता है जो बेस रूटिंग लॉजिक के साथ संयोजित होते हैं।
लेख दिखाता है कि यह मॉडल स्केलिंग के दौरान संतृप्ति समस्याओं को कैसे रोकता है, और विभिन्न कंकरेंसी स्तरों पर लेटेंसी बनाम थ्रूपुट जैसे टेस्टिंग प्रोफ़ाइल्स का परीक्षण करने की महत्वता को उजागर करता है ताकि उत्पादन में रुकावट से बचा जा सके।