MiniMax выпустила MiniMax H3, мультимодальную модель генерации видео с открытыми весами, способную обрабатывать текст, изображения, видео и аудио. Модель совместно генерирует визуальный ряд и синхронизированный стереоаудио, включая диалоги, звуковые эффекты, фоновые шумы и музыку, а не добавляет аудио как этап постобработки.
- Поддерживает преобразование текста в видео, изображения в видео, генерацию первого и последнего кадров, а также создание на основе референсов в ComfyUI.
- Открытые веса чекпоинтов позволяют создавать клипы длительностью до 15 секунд при разрешении 768p.
- Хостинговая версия модели поддерживает генерацию с разрешением до 2K.
- Использует высококомпрессированное представление видео для повышения эффективности в рамках нескольких задач генерации в единой архитектуре.
Выпуск позволяет разработчикам настраивать модель локально через ComfyUI для интегрированного синтеза визуального и аудио контента.