Black Forest Labs выпустила FLUX 3 — мультимодельную базовую модель, обучающуюся на изображениях, видео и аудио в рамках единой архитектуры. Это первая модель FLUX, которая обеспечивает генерацию видео, аудио и предсказание действий с использованием одного набора весов.
- Модель построена на методе Self-Flow, сочетающем согласование потока (flow matching) с самонадзором для реконструкции признаков.
- FLUX 3 Video генерирует клипы длительностью до 20 секунд за один проход с нативным аудио.
- Поддерживаемые режимы включают text-to-video, image-to-video, video-to-video, keyframe-to-video и генеративное продолжение видео-аудио.
- В тестах предпочтений людей для 10-секундных клипов в разрешении 720p модель FLUX 3 была предпочтительнее Luma Ray 3.2 в 93% сравнений и Runway Gen-4.5 в 77%.
Выпуск направлен на предоставление единой модели, где модальности ограничивают друг друга, обеспечивая соответствие звука воздействию и подчинение движения законам массы.