MiniMax이(가) MiniMax-H3 모델을 Hugging Face에서 공개했습니다. 이 범용 올모달 생성 시스템은 텍스트, 이미지, 비디오, 오디오로 구성된 멀티모달 컨텍스트의 통합 이해를 지원합니다.

  • 2K 해상도 및 최대 15초 길이의 네이티브 스테레오 오디오가 포함된 비디오를 생성할 수 있습니다.
  • 이 모델은 사전 학습 단계에서 광범위한 멀티모달 컨텍스트 이해 및 생성 능력을 갖추고 있습니다.
  • 이러한 설계는 복잡한 멀티모달 지시를 따르는 데 뛰어난 성능을 가능하게 합니다.