Diffusers-workflow est un moteur déclaratif construit au-dessus de Hugging Face Diffusers qui permet aux agents de grands modèles linguistiques d'auteur, valider, exécuter et inspecter des pipelines d'images ou de vidéos à l'aide de documents JSON plutôt que de scripts Python. Il expose un serveur MCP avec environ 50 outils comme interface principale, permettant un contrôle non supervisé par les agents sur les ressources GPU.

  • Le système comprend un outil `validate_workflow` qui vérifie le schéma et les signatures du pipeline sans charger les modèles pour détecter les erreurs tôt.
  • Les opérations coûteuses comme l'exécution de workflows ou le téléchargement de modèles nécessitent un indicateur explicite `acknowledged_cost=true` pour empêcher les dépenses non autorisées.
  • Les workflows sont définis comme des listes d'étapes nommées avec des références de variables, ce qui les rend composable, comparable via git-diff et répétable avec des résultats mis en cache.
  • Le moteur prend en charge diverses méthodes de quantification, accélérateurs de cache, LoRA, IP-Adapter et backends matériels comme CUDA, MPS et CPU.

Cette approche permet aux agents de gérer des tâches de génération multi-étapes, telles que la chaîne de text-to-image vers des pipelines vidéo, tout en assurant la sécurité des ressources et la reproductibilité.