أطلقت مينimax نموذج MiniMax H3، وهو نموذج توليد متعدد الوسائط للأغراض العامة يفهم السياق الموحد عبر النص والصور والفيديو والصوت. يولد النموذج فيديو بصوت ستيريو أصلي لمدة تصل إلى 15 ثانية ودقة 2K.

  • يتميز H3 بتقنيات Contextual Omni Representation و H3-VAE و H3-Omni Transformer و In-Context Regeneration.
  • يتفوق في اتباع التعليمات، وعرض النص والعلامات التجارية بدقة، ونقل الحركة V2V.
  • عند دقة 2K، يكون السعر لكل ثانية أقل من ثلث أسعار النماذج الرئيسية؛ وعند 768p، هو أقل من نصف سعر 720p للنماذج الرئيسية.
  • تخطط MiniMax لإطلاق الأوزان المفتوحة في الأيام القادمة لدعم مجتمع المصدر المفتوح وتسريع توافق الأجهزة.

يهدف الإصدار إلى معالجة هيمنة نماذج توليد الفيديو مغلقة المصدر من خلال توفير نظام بيئي مفتوح وإصدارات قابلة للتخصيص للمستخدمين.