MiniMax는 텍스트, 이미지, 비디오, 오디오를 단일 컨텍스트에 통합하여 최대 15초 길이의 2K 비디오 클립과 네이티브 스테레오 사운드를 생성할 수 있는 범용 멀티모달 생성 모델인 MiniMax H3를 출시했습니다. 이전의 특정 작업에 전용 전문가 모델을 의존하던 스택과 달리, H3는 사용자가 자연어 프롬프트를 통해 참조 및 편집 관계를 표현할 수 있게 합니다.
- 이 모델은 4~15초(정수만 해당) 길이의 2K 해상도 비디오를 출력합니다.
- 유효 시퀀스 길이를 4배 향상시켜 네이티브 2K 출력을 가능하게 하는 H3-VAE 토크나이저를 특징으로 합니다.
- H3-Omni Transformer는 이해와 생성 작업을 분리하여 엔드투엔드 학습 처리량을 약 30% 증가시켰습니다.
- 인컨텍스트 재생성을 통해 기본 모델은 외부 슈퍼리졸루션 모듈 없이도 미세한 디테일과 작은 텍스트를 복원할 수 있습니다.
- 가격은 2K 출력당 초당 $0.13으로 보고되었으며, 이는 MiniMax가 주류 모델의 3분의 1 미만이라고 주장하는 가격입니다.
MiniMax H3는 현재 모델 ID MiniMax-H3로 플랫폼 API를 통해, 그리고 소비자용 Hailuo AI 앱을 통해 사용 가능하며, 오픈 가중치는 다가오는 날에 공개될 예정입니다.