A Black Forest Labs lançou o FLUX 3, um modelo de fundação multimodal que aprende a partir de imagens, vídeos e áudio em uma única arquitetura. É o primeiro modelo FLUX a disponibilizar previsão de vídeo, áudio e ação a partir de um único conjunto de pesos.
- O modelo se baseia no método Self-Flow, combinando correspondência de fluxo com reconstrução de recursos auto-supervisionada.
- O FLUX 3 Video gera clipes de até 20 segundos em uma única geração, com áudio nativo.
- Os modos suportados incluem texto para vídeo, imagem para vídeo, vídeo para vídeo, quadro-chave para vídeo e continuação generativa de vídeo e áudio.
- Em testes de preferência humana para clipes de 10 segundos em 720p, o FLUX 3 foi preferido ao Luma Ray 3.2 em 93% das comparações e ao Runway Gen-4.5 em 77%.
O lançamento visa fornecer um modelo unificado onde as modalidades se restringem mutuamente, garantindo que o som corresponda ao impacto e que o movimento obedeça à massa.