MiniMax ने Hugging Face पर ओपन-वेट H3 ओमनी-मोडल वीडियो जनरेशन मॉडल जारी किया, जिसमें नेटिव स्टीरियो ऑडियो है जो एक फॉरवर्ड पास में वीडियो को चला सकता है। मॉडल 5 से 15 सेकंड तक के क्लिप्स के लिए 2K रिज़ॉल्यूशन और 24fps का समर्थन करता है और प्रति जनरेशन नौ रेफरेंस इमेज, तीन वीडियो और तीन ऑडियो क्लिप स्वीकार करता है।

  • H3 साझा संदर्भ के भीतर टेक्स्ट, इमेज, वीडियो और ऑडियो इनपुट की अनुमति देता है।
  • ऑडियो-ड्रिवन मोड इनपुट साउंड ट्रैक के साथ सिंक किया गया वीडियो जनरेट करता है।
  • मॉडल कंज्यूमर हार्डवेयर पर स्थानीय इन्फरेंस के लिए ओपन वेट्स के रूप में उपलब्ध है।
  • ByteDance का Seedance 2.5 समान क्षमताएं प्रदान करता है लेकिन BytePlus ModelArk के माध्यम से केवल API तक सीमित है।

H3 की उपलब्धता स्थानीय वीडियो जनरेशन के लिए एक महत्वपूर्ण मील का पत्थर है, जिसने उच्च गुणवत्ता वाले परिणाम प्रदान किए हैं जो पहले केवल प्रोप्राइटरी APIs के माध्यम से सुलभ थे।