Together ने अपने इनफरेंस प्लेटफ़ॉर्म में एक महत्वपूर्ण अपडेट जारी किया है, जिसमें "Dedicated Model Inference" का परिचय दिया गया है, जो उपयोगकर्ताओं को ओपन-वेट मॉडल्स के लिए प्रदर्शन, लागत और गुणवत्ता पर पूर्ण नियंत्रण देने के लिए डिज़ाइन किया गया है। इस अपडेट में कस्टम ट्रेनिंग क्षमताओं के लिए एक बंद बीटा भी घोषित किया गया है, जिसमें फुल-वेट और LoRA रीइन्फोर्समेंट लर्निंग शामिल हैं।

  • डिप्लॉयमेंट्स में कैनरी, ब्लू-ग्रीन और रोलिंग अपडेट का समर्थन होता है, जिसमें थ्रेशोल्ड उल्लंघन पर स्वचालित रोलबैक होता है।
  • A/B और शैडो टेस्टिंग नए वेट्स का मूल्यांकन वास्तविक ट्रैफ़िक के साथ करने की अनुमति देती है, बिना उपयोगकर्ताओं को प्रभावित किए।
  • मॉडल कैशिंग और वितरण परतों को फिर से बनाया गया है ताकि लगभग 4× तेज़ वार्म स्टार्ट्स प्रदान किए जा सकें।
  • ऑटोस्केलिंग में इनफ्लाइट रिक्वेस्ट, GPU उपयोगिता और टोकन तक समय जैसी मेट्रिक्स का समर्थन होता है।
  • कस्टम ट्रेनिंग बीटा में सुपरवाइज्ड फाइन-ट्यूनिंग शामिल है, जिसमें चेकपॉइंट्स को सीधे प्रोडक्शन में डिप्लॉय किया जा सकता है।

प्लेटफ़ॉर्म का उद्देश्य डिप्लॉयमेंट लाइफसाइकल मैनेजमेंट और ओब्ज़र्वेबिलिटी को संभालकर एक्सपेरिमेंटेशन से प्रोडक्शन की ओर संक्रमण को सरल बनाना है, जिससे टीमें मॉडल वर्जन पर साप्ताहिक रूप से सुरक्षित रूप से इटरेट कर सकें।