Black Forest Labs는 단일 아키텍처 내에서 이미지, 비디오, 오디오에서 학습하는 멀티모달 파운데이션 모델인 FLUX 3를 출시했습니다. 이는 하나의 가중치 세트에서 비디오, 오디오 및 액션 예측을 제공하는 최초의 FLUX 모델입니다.

  • 이 모델은 Self-Flow 방법을 기반으로 하여 플로우 매칭과 자기지도 특징 재구성을 결합합니다.
  • FLUX 3 Video는 네이티브 오디오와 함께 단일 생성으로 최대 20초 길이의 클립을 생성합니다.
  • 지원되는 모드에는 텍스트-비디오, 이미지-비디오, 비디오-비디오, 키프레임-비디오 및 생성적 비디오-오디오 연속성이 포함됩니다.

10초 길이 720p 클립에 대한 인간 선호도 테스트에서 FLUX 3는 Luma Ray 3.2와의 비교에서 93%의 경우, Runway Gen-4.5와의 비교에서 77%의 경우 더 선호되었습니다.

이 출시는 모달리티가 서로를 제약하여 소리가 영향과 일치하고 운동이 질량을 따르도록 보장하는 통합 모델을 제공하는 것을 목표로 합니다.