Компания MiniMax выпустила модель генерации MiniMax H3, универсальную мультимодальную модель, которая понимает единый контекст для текста, изображений, видео и аудио. Модель генерирует видео с нативным стереозвуком длительностью до 15 секунд и разрешением 2K.
- H3 включает технологии Contextual Omni Representation, H3-VAE, H3-Omni Transformer и In-Context Regeneration.
- Она отлично справляется с выполнением инструкций, точным отображением текста и брендов, а также переносом движения V2V.
- При разрешении 2K цена за секунду составляет менее трети от стоимости основных моделей; при 768p она менее половины цены на 720p у основных моделей.
- MiniMax планирует выпустить открытые веса в ближайшие дни, чтобы поддержать сообщество open-source и ускорить совместимость с оборудованием.
Выпуск направлен на преодоление доминирования закрытых видео-генераторов за счет предоставления открытой экосистемы и настраиваемых версий для пользователей.