एक उपयोगकर्ता ने INT4 क्वांटीकरण का उपयोग करके NVIDIA के 64-अरब पैरामीटर वाले Cosmos3 मॉडल को स्थानीय रूप से चलाने के लिए कोड और वजन प्रकाशित किए हैं। इस कार्यान्वयन में Apple Silicon पर MLX के माध्यम से और CUDA दोनों पर टेक्स्ट-टू-इमेज और इमेज-टू-वीडियो कार्य सहायता प्राप्त है।
- रिपॉजिटरी Cosmos3-Super-Text2Image-4Step-INT4-G64-BF16 मॉडल के लिए GitHub कोड और Hugging Face वजन प्रदान करती है।
- क्वांटीकरण 64B पैरामीटर वाले बड़े मॉडल को उपभोक्ता हार्डवेयर पर चलाने की अनुमति देता है, जहाँ M4 Max Mac पर 128 GB मेमोरी के साथ एक क्लिप उत्पन्न करने में लगभग पाँच मिनट लगते हैं।
- प्रदर्शन क्षमताओं को दिखाने के लिए इस परियोजना में Grok के साथ तुलना शामिल है।
यह रिलीस उन उपकरणों पर स्थानीय इनफरेंस को सक्षम बनाती है जिनमें आमतौर पर पूर्ण-सटीकता वजन के लिए आवश्यक VRAM नहीं होता है।