Diffusers-workflowは、Hugging Face Diffusersの上に構築された宣言型エンジンであり、大規模言語モデルのエージェントがPythonスクリプトの代わりにJSONドキュメントを使用して画像または動画のパイプラインを作成、検証、実行、および検査できるようにします。約50個のツールを備えたMCPサーバーを主要なインターフェースとして公開し、GPUリソースに対する無人のエージェント制御を可能にします。

  • システムには、モデルを読み込まずにスキーマとパイプラインのシグネチャをチェックして早期にエラーを検出する`validate_workflow`ツールが含まれています。
  • ワークフローの実行やモデルのダウンロードなどの高コストな操作では、不正な支出を防ぐために明示的な`acknowledged_cost=true`フラグが必要です。
  • ワークフローは変数参照付きの名前付きステップのリストとして定義されており、組み合わせ可能でgit diff可能、かつキャッシュされた結果で繰り返し実行可能です。
  • エンジンはさまざまな量子化手法、キャッシュアクセラレータ、LoRA、IP-Adapter、CUDA、MPS、CPUなどのハードウェアバックエンドをサポートしています。

このアプローチにより、エージェントはテキストから画像への変換を動画パイプラインにチェーンするなど、マルチステージの生成タスクを管理しながら、リソースの安全性と再現性を確保できます。