हगिंग फेस फोरम पर एक प्रस्ताव सामान्य GPU एक्जीक्यूशन और मेमोरी-मैनेजमेंट लेयर की रूपरेखा तैयार करता है, जिसे NVIDIA, AMD और Intel जैसे विशिष्ट हार्डवेयर वेंडर्स से एप्लिकेशन कोड को अलग करने के लिए डिज़ाइन किया गया है। इसका उद्देश्य उपयोगकर्ताओं को मैन्युअल रूप से बैकएंड-विशिष्ट फ्लैग, डिवाइस मैप्स या ऑफलोडिंग रणनीतियों को कॉन्फ़िगर करने के बजाय एक मेमोरी बजट निर्धारित करने की अनुमति देना है।
- रनटाइम उपलब्ध VRAM के आधार पर लेयर प्लेसमेंट, प्रिसिशन चयन (INT4, INT8, FP8) और KV कैश मैनेजमेंट स्वचालित रूप से निर्धारित करेगा।
- इसमें GPU लोकल VRAM, एक्सपेंशन मेमोरी, सिस्टम RAM और NVMe स्टोरेज के लिए स्तरों के साथ एक हियरार्किकल मेमोरी मॉडल पेश किया गया है।
- डीक्वांटीज़ेशन बफर्स द्वारा क्वांटीज़ेशन लाभ को नकारने से रोकने के लिए लो-बिट डेटा टाइप्स को फर्स्ट-क्लास रनटाइम फीचर्स के रूप में प्रस्तावित किया गया है।
- आर्किटेक्चर पूरे रनटाइम मेमोरी फुटप्रिंट को नियंत्रित करके 12 GB कंज्यूमर GPUs पर 13B-class INT4 इनफरेंस को व्यावहारिक बनाने का लक्ष्य रखता है।
यह दृष्टिकोण विखंडित सॉफ्टवेयर संगतता और VRAM सीमाओं को संबोधित करने का प्रयास करता है, जिससे AI वर्कलोड्स को CUDA या अन्य वेंडर-विशिष्ट बैकएंड्स के साथ कसकर जुड़े बिना मल्टी-वेंडर GPU बाजारों में कुशलता से चलाने की सुविधा मिलती है।