Together AI ने अपने डेडिकेटेड मॉडल इनफरेंस प्लेटफ़ॉर्म में ऑटोस्केलिंग क्षमताएं जोड़ी हैं, जिससे डिप्लॉयमेंट्स को इनफरेंस इंजन द्वारा समझे जाने वाले मीट्रिक्स के आधार पर स्केल किया जा सकता है, जैसे कि इन-फ्लाइट रिक्वेस्ट, टाइम-टू-फर्स्ट-टोकन (TTFT), और GPU उपयोगिता।
- सिस्टम स्केलिंग को ऊपर और नीचे प्रबंधित करने के लिए कॉन्फ़िगर करने योग्य रेप्लिका सीमाओं और टाइमिंग विंडो के साथ एक प्रोपोर्शनल कंट्रोल लूप का उपयोग करता है।
- उपयोगकर्ता आठ मीट्रिक्स में से चुन सकते हैं, जिन्हें कॉन्करेंसी-ड्राइवन (उदाहरण के लिए, inflight_requests), SLO-ड्राइवन (उदाहरण के लिए, ttft), या एफिशिएंसी-ड्राइवन (उदाहरण के लिए, gpu_utilization) के रूप में वर्गीकृत किया गया है।
- कॉन्करेंसी-ड्राइवन मीट्रिक्स को डिफ़ॉल्ट के रूप में अनुशंसित किया जाता है क्योंकि वे लेटेन्सी खराब होने से पहले लोड के लिए अग्रणी संकेतक के रूप में कार्य करते हैं।
- प्लेटफ़ॉर्म ऑटोमैटिक स्केल-टू-ज़ीरो का समर्थन नहीं करता है; न्यूनतम और अधिकतम रेप्लिका को 0 पर सेट करने से डिप्लॉयमेंट स्पष्ट रूप से बंद हो जाता है।
- Qwen3.5-9B मॉडल के साथ एक प्रयोग ने दिखाया कि ट्रैफ़िक स्पाइक के दौरान केवल inflight_requests मीट्रिक सफलतापूर्वक स्केल हुआ, जबकि TTFT और GPU उपयोगिता नीतियां प्रतिक्रिया करने में विफल रहीं।
ऑटोस्केलिंग आइडल GPUs की ओवर-प्रविज़निंग और पीक ट्रैफ़िक के दौरान गंभीर लेटेन्सी खराब होने का कारण बनने वाली अंडर-प्रविज़निंग को रोककर लागत और प्रदर्शन के बीच संतुलन बनाए रखने में मदद करता है।