Black Forest Labs a publié FLUX 3, un modèle fondamental multimodal qui apprend à partir d'images, de vidéos et d'audio au sein d'une seule architecture. C'est le premier modèle FLUX à proposer la prédiction de vidéos, d'audio et d'actions à partir d'un seul ensemble de poids.
- Le modèle s'appuie sur la méthode Self-Flow, combinant l'appariement de flux avec la reconstruction de caractéristiques auto-supervisée.
- FLUX 3 Video génère des clips jusqu'à 20 secondes dans une seule génération avec un audio natif.
- Les modes pris en charge incluent le texte-vers-vidéo, l'image-vers-vidéo, la vidéo-vers-vidéo, l'image-clé-vers-vidéo et la continuation vidéo-audio générative.
- Dans les tests de préférence humaine pour des clips 720p de 10 secondes, FLUX 3 a été préféré à Luma Ray 3.2 dans 93 % des comparaisons et à Runway Gen-4.5 dans 77 %.
La publication vise à fournir un modèle unifié où les modalités se contraignent mutuellement, garantissant que le son correspond à l'impact et que le mouvement obéit à la masse.