MiniMax выпустила омнимодальную модель генерации видео H3 с открытыми весами на Hugging Face, оснащенную нативным стереозвуком, который может управлять видео за один прямой проход. Модель поддерживает разрешение 2K при 24 кадрах в секунду для клипов длительностью от 5 до 15 секунд и принимает до девяти референсных изображений, трех видео и трех аудиоклипов на одну генерацию.

  • H3 позволяет использовать текстовые, визуальные, видеовходные данные и аудио в общем контексте.
  • Режим, управляемый звуком, генерирует видео, синхронизированное с входным звуковым треком.
  • Модель доступна с открытыми весами для локального инференса на потребительском оборудовании.
  • Seedance 2.5 от ByteDance предлагает аналогичные возможности, но остается доступной только через API в BytePlus ModelArk.

Доступность H3 представляет собой значительную веху для локальной генерации видео, обеспечивая высокое качество результатов, которые ранее были доступны только через проприетарные API.