أطلقت MiniMax نموذج MiniMax H3، وهو نموذج متعدد الوسائط لتوليد الفيديو بوزن مفتوح قادر على معالجة النص والصور ومقاطع الفيديو والصوت. يقوم النموذج بتوليد الصور والصوت المجسم المتزامن بشكل مشترك، بما في ذلك الحوارات والمؤثرات الصوتية والأجواء والموسيقى، بدلاً من إضافة الصوت كخطوة ما بعد المعالجة.
- يدعم تحويل النص إلى فيديو، والصورة إلى فيديو، وتوليد الإطار الأول والأخير، وإنشاء مدفوع بالمرجع داخل ComfyUI.
- تسمح نقاط التفتيش ذات الأوزان المفتوحة بمقاطع تصل إلى 15 ثانية بدقة 768p.
- تدعم النسخة المستضافة من النموذج التوليد بدقة تصل إلى 2K.
- تستخدم تمثيل فيديو عالي الضغط لتحسين الكفاءة عبر مهام توليد متعددة في بنية واحدة.
يتيح الإطلاق للمطورين إعداد النموذج محليًا عبر ComfyUI للتركيب المتكامل للصور والصوت.