मिनीमैक्स ने मिनीमैक्स एच3 जारी किया, एक सामान्य-उद्देश्य बहु-मोडल जनरेशन मॉडल जो टेक्स्ट, इमेज, वीडियो और ऑडियो को एक ही संदर्भ में एकीकृत करता है ताकि नेटिव स्टीरियो ध्वनि के साथ 15 सेकंड तक लंबे 2K वीडियो क्लिप उत्पन्न किए जा सकें। पिछले स्टैक्स के विपरीत जो विशिष्ट कार्यों के लिए अलग-अलग विशेषज्ञ मॉडल पर निर्भर करते हैं, एच3 उपयोगकर्ताओं को प्राकृतिक भाषा प्रॉम्प्ट्स के माध्यम से संदर्भ और संपादन संबंधों को व्यक्त करने की अनुमति देता है।
- मॉडल 4–15 सेकंड की अवधि (केवल पूर्णांक) के साथ 2K रिज़ॉल्यूशन वीडियो आउटपुट करता है।
- इसमें एच3-VaE टोकनाइजर शामिल है, जो प्रभावी सीक्वेंस लंबाई में 4x की वृद्धि प्रदान करता है, जिससे नेटिव 2K आउटपुट संभव होता है।
- एच3-ओम्नी ट्रान्सफॉर्मर समझ और जनरेशन कार्यभार को अलग करता है, जिससे एंड-टू-एंड ट्रेनिंग थ्रूपुट में लगभग 30% की वृद्धि होती है।
- इन-कंटेक्स्ट रीजनरेशन बेस मॉडल को बाहरी सुपर-रिज़ॉल्यूशन मॉड्यूल के बिना सूक्ष्म विवरण और छोटे टेक्स्ट को पुनः प्राप्त करने की अनुमति देता है।
- 2K आउटपुट के लिए प्रति सेकंड $0.13 की कीमत बताई गई है, जिसका दावा मिनीमैक्स द्वारा किया गया है कि यह प्रमुख मॉडल का एक तिहाई से भी कम है।
मिनीमैक्स एच3 वर्तमान में मॉडल आईडी MiniMax-H3 के तहत प्लेटफ़ॉर्म API के माध्यम से और उपभोक्ता Hailuo AI ऐप में उपलब्ध है, और आने वाले दिनों में ओपन वेट्स का वादा किया गया है।