أصدرت MiniMax نموذجها MiniMax-H3 على Hugging Face. يدعم هذا النظام التوليدي متعدد الوسائط الشامل الفهم الموحد للسياقات متعددة الوسائط المكونة من النص والصور ومقاطع الفيديو والصوت.

  • يمكنه توليد فيديو بصوت ستيريو أصلي بدقة تصل إلى 2K ولمدة تصل إلى 15 ثانية.
  • يمتلك النموذج قدرات واسعة لفهم وتوليد سياقات متعددة الوسائط في مرحلة التدريب المسبق.
  • يتيح هذا التصميم أداءً متميزًا في اتباع التعليمات المعقدة متعددة الوسائط.