MiniMax сделала свою модель MiniMax-H3 доступной на Hugging Face. Эта универсальная омнимодальная генеративная система поддерживает единое понимание мультимодальных контекстов, состоящих из текста, изображений, видео и аудио.
- Она может генерировать видео с нативным стереоаудио в разрешениях до 2K и длительностью до 15 секунд.
- Модель обладает широкими возможностями понимания и генерации мультимодальных контекстов на этапе предварительного обучения.
- Этот дизайн обеспечивает выдающуюся производительность при следовании сложным мультимодальным инструкциям.