Компания MiniMax выпустила модель MiniMax H3 — универсальную мультимодальную модель генерации, которая объединяет текст, изображения, видео и аудио в едином контексте для создания видеоклипов длительностью до 15 секунд с нативным стереозвуком. В отличие от предыдущих стеков, использующих отдельные специализированные модели для конкретных задач, H3 позволяет пользователям задавать отношения между ссылками и редактированием с помощью текстовых запросов.

  • Модель генерирует видео в разрешении 2K длительностью от 4 до 15 секунд (только целые числа).
  • В её составе используется токенизатор H3-VAE, обеспечивающий увеличение эффективной длины последовательности в 4 раза, что позволяет получать вывод в нативном разрешении 2K.
  • Трансформер H3-Omni разделяет задачи понимания и генерации, увеличивая пропускную способность сквозного обучения почти на 30%.
  • Возможность регенерации в контексте позволяет базовой модели восстанавливать мелкие детали и текст без внешних модулей суперразрешения.
  • Стоимость составляет $0.13 за секунду вывода в разрешении 2K, что, по утверждению MiniMax, менее чем в три раза дешевле популярных моделей.

Модель MiniMax H3 доступна через API платформы под идентификатором модели MiniMax-H3 и в потребительском приложении Hailuo AI; открытый доступ к весам обещают в ближайшие дни.