أطلقت مينيماكس نموذج توليد الفيديو الشامل H3 ذو الأوزان المفتوحة على Hugging Face، والذي يتميز بصوت ستيريو أصلي يمكنه تشغيل الفيديو في تمرير أمامي واحد. يدعم النموذج دقة 2K بمعدل 24 إطارًا في الثانية للقطات التي تتراوح مدتها من 5 إلى 15 ثانية ويقبل ما يصل إلى تسع صور مرجعية وثلاثة مقاطع فيديو وثلاثة مقاطع صوتية لكل عملية توليد.
- يسمح H3 بإدخال النص والصورة والفيديو والصوت ضمن سياق مشترك.
- يولد الوضع المدعوم بالصوت فيديو متزامنًا مع مسار الصوت المدخل.
- يتوفر النموذج بأوزان مفتوحة للاستنتاج المحلي على الأجهزة الاستهلاكية.
- يقدم Seedance 2.5 من بايت دانس قدرات مماثلة لكنه يبقى متاحًا فقط عبر API في BytePlus ModelArk.
تمثل توفرية H3 محطة مهمة لتوليد الفيديو محليًا، حيث تقدم نتائج عالية الجودة كانت متاحة سابقًا فقط عبر واجهات برمجة التطبيقات الخاصة.