MiniMax выпустила омнимодальную модель генерации видео H3 с открытыми весами на Hugging Face, оснащенную нативным стереозвуком, который может управлять видео за один прямой проход. Модель поддерживает разрешение 2K при 24 кадрах в секунду для клипов длительностью от 5 до 15 секунд и принимает до девяти референсных изображений, трех видео и трех аудиоклипов на одну генерацию.
- H3 позволяет использовать текстовые, визуальные, видеовходные данные и аудио в общем контексте.
- Режим, управляемый звуком, генерирует видео, синхронизированное с входным звуковым треком.
- Модель доступна с открытыми весами для локального инференса на потребительском оборудовании.
- Seedance 2.5 от ByteDance предлагает аналогичные возможности, но остается доступной только через API в BytePlus ModelArk.
Доступность H3 представляет собой значительную веху для локальной генерации видео, обеспечивая высокое качество результатов, которые ранее были доступны только через проприетарные API.