Black Forest Labsは、単一のアーキテクチャ内で画像、動画、音声から学習するマルチモーダル基盤モデルであるFLUX 3をリリースしました。これは、1つの重みセットから動画、音声、動作の予測を出力する初のFLUXモデルです。
- このモデルはSelf-Flow手法に基づき、フローマッチングと自己教師あり特徴再構築を組み合わせています。
- FLUX 3 Videoは、ネイティブ音声を伴う20秒までのクリップを1回の生成で出力します。
- サポートされているモードには、テキストから動画へ、画像から動画へ、動画から動画へ、キーフレームから動画へ、および生成型動画音声継続が含まれます。
- 10秒間の720pクリップに関する人間の好みテストでは、FLUX 3はLuma Ray 3.2との比較で93%、Runway Gen-4.5との比較で77%のケースで好まれました。
今回のリリースは、各モダリティが互いに制約し合う統合モデルを提供することを目的としており、音声がインパクトと一致し、運動が質量に従うことを保証します。