Gradioは、gr.Workflowフレームワークを使用してAUTOMATIC1111のstable-diffusion-webuiの機能セットの大部分を再構築したプロジェクトであるWorkflow1111をリリースしました。このアプリケーションは、73ノードから構築された11のメディアパイプラインを含む単一のキャンバスで構成されており、テキストから画像への変換、画像から動画への変換、および各種前処理タスクをカバーしています。
- ワークフローは、テキストから画像への生成、高解像度化補正、画像から画像への変換、プロンプトマトリックスグリッド、VLM(視覚言語モデル)の照会、検出からインペイントマスクへの生成、ControlNetスタイルのアノテーター、背景除去、PNG Infoの保存、および画像から動画への変換のためのSOTAモデルを統合しています。
- 4つの演算子タイプを利用しています:fn(Python関数)、model(InferenceClient経由)、space(他のGradio Spaces)、dataset(Hubの行)。
- ユーザーはHugging Faceアカウントでサインインするか、アクセストークンを提供してパイプラインを実行でき、モデル呼び出しには独自のクォータを使用します。
- システムはすべての出力ノードをRESTエンドポイントとMCPツールとして公開しており、AIアシスタントが生成、検出、およびメタデータ取得の手順を呼び出すことができます。
- デフォルトの実行ではInference Providers経由でリモートハードウェアを使用しますが、fnノードはローカルチェックポイントも読み込み、ユーザー自身のGPU上で実行することも可能です。
このアプローチにより、ユーザーはボンドコードの記述や依存関係のインストールなしに、ブラウザ内で複雑なマルチモデルパイプラインを構築、共有、および修正することができます。