ब्लैक फॉरेस्ट लैब्स ने FLUX 3 जारी किया है, जो छवियों, वीडियो और ऑडियो से एक ही आर्किटेक्चर में सीखने वाला एक बहुआयामी आधार मॉडल है। यह पहला FLUX मॉडल है जिसने एक ही सेट के वजन से वीडियो, ऑडियो और एक्शन भविष्यवाणी को शिप किया है।
- मॉडल सेल्फ-फ्लो विधि पर आधारित है, जो फ्लो मैचिंग को स्वयं-सुपरवाइज्ड फीचर पुनर्निर्माण के साथ जोड़ता है।
- FLUX 3 Video नेटिव ऑडियो के साथ एकल जनरेशन में 20 सेकंड तक की क्लिप उत्पन्न करता है।
- समर्थित मोड में टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, वीडियो-टू-वीडियो, कीफ्रेम-टू-वीडियो और जनरेटिव वीडियो-ऑडियो कंटिन्यूएशन शामिल हैं।
10 सेकंड की 720p क्लिप के लिए मानव प्राथमिकता परीक्षणों में, FLUX 3 ने तुलनाओं के 93% में Luma Ray 3.2 और 77% में Runway Gen-4.5 को पसंद किया गया।
रिलीज का उद्देश्य एक एकीकृत मॉडल प्रदान करना है जहाँ मोडैलिटी एक दूसरे को प्रतिबंधित करती हैं, यह सुनिश्चित करते हुए कि ध्वनि प्रभाव से मेल खाती है और गति द्रव्यमान का पालन करती है।