أطلقت Black Forest Labs FLUX 3، وهو نموذج أساسي متعدد الوسائط يتعلم من الصور ومقاطع الفيديو والصوت ضمن بنية واحدة. إنه أول نموذج FLUX يُصدر التنبؤ بالفيديو والصوت والحركة من مجموعة واحدة من الأوزان.
- يبني النموذج على طريقة Self-Flow، حيث يجمع بين مطابقة التدفق وإعادة بناء الميزات ذاتيًا.
- ينتج FLUX 3 Video مقاطع تصل مدتها إلى 20 ثانية في توليد واحد مع صوت أصلي.
- تشمل الأوضاع المدعومة النص إلى فيديو، والصورة إلى فيديو، والفيديو إلى فيديو، والإطار الرئيسي إلى فيديو، واستمرار الفيديو والصوت التوليدي.
- في اختبارات تفضيل الإنسان لمقاطع 720p مدتها 10 ثوانٍ، كان FLUX 3 مفضلاً على Luma Ray 3.2 في 93% من المقارنات وعلى Runway Gen-4.5 في 77%.
يهدف الإصدار إلى توفير نموذج موحد حيث تقيد الوسائط بعضها البعض، مما يضمن تطابق الصوت مع التأثير وامتثال الحركة للكتلة.