MiniMax сделала свою модель MiniMax-H3 доступной на Hugging Face. Эта универсальная омнимодальная генеративная система поддерживает единое понимание мультимодальных контекстов, состоящих из текста, изображений, видео и аудио.

  • Она может генерировать видео с нативным стереоаудио в разрешениях до 2K и длительностью до 15 секунд.
  • Модель обладает широкими возможностями понимания и генерации мультимодальных контекстов на этапе предварительного обучения.
  • Этот дизайн обеспечивает выдающуюся производительность при следовании сложным мультимодальным инструкциям.