アリババのQwenチームは、以前の個別チェックポイントを単一の7Bパラメータ拡散トランスフォーマーに統合した、テキストから画像への生成および画像編集用の統一モデルであるQwen-Image-2.1をリリースしました。

  • 本モデルは、ブロック因果的注意機構を持つ7B DiTと、テキストや条件画像を処理するための8B Qwen3-VLエンコーダーを使用しています。
  • ネイティブなRGBA透明度、最大10枚の画像によるマルチリファレンス編集、アイデンティティを保持したローカル領域編集をサポートします。
  • 混合粒度の注意機構により、プレフィックスKVキャッシュの再利用が可能となり、生成ステップごとにテキストと参照入力を一度だけ計算します。
  • Qwenの社内ベンチマークであるQwen-Image-Benchにおいて60.28点を記録し、FLUX 2 Max (55.33)などのオープンウェイトモデルを上回りますが、GPT Image 2.5 Sunburst (67.01)などのクローズドモデルには及びません。
  • リリースにはDiffusers、ComfyUI、vLLM-Omni、SGLangのDay 0サポートが含まれており、商用利用には別途ライセンスが必要です。

この統一アーキテクチャは、高い美的品質と透明度サポートを維持しつつ、生成および編集タスクのコスト効果的なソリューションを提供することを目指しています。