MiniMax ने MiniMax H3 जारी किया है, जो एक ओपन-वेइट मल्टीमोडल वीडियो जनरेशन मॉडल है जो टेक्स्ट, छवियों, वीडियो और ऑडियो को प्रोसेस करने में सक्षम है। मॉडल दृश्य और समन्वित स्टीरियो ऑडियो का संयुक्त उत्पादन करता है, जिसमें संवाद, ध्वनि प्रभाव, पृष्ठभूमि और संगीत शामिल हैं, न कि ऑडियो को एक पोस्ट-प्रोसेसिंग चरण के रूप में जोड़ना।
- ComfyUI के भीतर टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, पहले और आखिरी फ्रेम जनरेशन, और संदर्भ-चालित निर्माण का समर्थन करता है।
- ओपन-वेइट चेकपॉइंट्स 768p रिज़ॉल्यूशन पर 15 सेकंड तक के क्लिप्स की अनुमति देते हैं।
- मॉडल की होस्टेड संस्करण 2K रिज़ॉल्यूशन तक जनरेशन का समर्थन करता है।
- एकल आर्किटेक्चर में कई जनरेशन कार्यों के लिए दक्षता को बेहतर बनाने के लिए उच्च-कंप्रेशन वीडियो प्रतिनिधित्व का उपयोग करता है।
इस रिलीज से डेवलपर्स ComfyUI के माध्यम से मॉडल को स्थानीय रूप से सेटअप कर सकते हैं ताकि एकीकृत दृश्य और ऑडियो संश्लेषण हो सके।