Black Forest Labs telah merilis FLUX 3, sebuah model dasar multimodal yang belajar dari gambar, video, dan audio dalam satu arsitektur. Ini adalah model FLUX pertama yang mengirimkan prediksi video, audio, dan aksi dari satu set bobot.

  • Model ini dibangun di atas metode Self-Flow, menggabungkan pencocokan aliran dengan rekonstruksi fitur self-supervised.
  • FLUX 3 Video menghasilkan klip hingga durasi 20 detik dalam satu generasi dengan audio asli.
  • Mode yang didukung meliputi teks-ke-video, gambar-ke-video, video-ke-video, keyframe-ke-video, dan kelanjutan video-audio generatif.
  • Dalam tes preferensi manusia untuk klip 720p selama 10 detik, FLUX 3 lebih disukai daripada Luma Ray 3.2 dalam 93% perbandingan dan Runway Gen-4.5 dalam 77%.

Rilis ini bertujuan menyediakan model terpadu di mana modalitas saling membatasi, memastikan suara sesuai dengan dampak dan gerakan mematuhi massa.