Black Forest Labs ha lanzado FLUX 3, un modelo base multimodal que aprende a partir de imágenes, videos y audio dentro de una única arquitectura. Es el primer modelo FLUX en ofrecer predicción de video, audio y acción desde un solo conjunto de pesos.
- El modelo se basa en el método Self-Flow, combinando la coincidencia de flujos con la reconstrucción de características auto-supervisadas.
- FLUX 3 Video genera clips de hasta 20 segundos de duración en una sola generación con audio nativo.
- Los modos compatibles incluyen texto a video, imagen a video, video a video, fotograma clave a video y continuación generativa de video-audio.
- En pruebas de preferencia humana para clips de 10 segundos a 720p, FLUX 3 fue preferido sobre Luma Ray 3.2 en el 93% de las comparaciones y sobre Runway Gen-4.5 en el 77%.
El lanzamiento tiene como objetivo proporcionar un modelo unificado donde las modalidades se restringen mutuamente, asegurando que el sonido coincida con el impacto y que el movimiento obedezca a la masa.