أصدرت MiniMax نموذجها MiniMax-H3 على Hugging Face. يدعم هذا النظام التوليدي متعدد الوسائط الشامل الفهم الموحد للسياقات متعددة الوسائط المكونة من النص والصور ومقاطع الفيديو والصوت.
- يمكنه توليد فيديو بصوت ستيريو أصلي بدقة تصل إلى 2K ولمدة تصل إلى 15 ثانية.
- يمتلك النموذج قدرات واسعة لفهم وتوليد سياقات متعددة الوسائط في مرحلة التدريب المسبق.
- يتيح هذا التصميم أداءً متميزًا في اتباع التعليمات المعقدة متعددة الوسائط.