Les chercheurs proposent AutoRef, une méthode qui optimise automatiquement le harnais d'exécution pour la génération d'images multi-références par agents, tout en maintenant les modèles sous-jacents figés. Un agent de codage réécrit itérativement le code du harnais pour relever des défis tels que l'omission de sujets et des compositions antinaturelles.

  • Le système sépare les tâches de feedback des tâches de sélection et recherche en utilisant un faisceau de harnais les mieux classés.
  • AutoRef-Harness améliore la note du modèle FLUX.2 4B à poids ouvert sur les tâches à quatre références retenues de MultiBanana, passant de 5.72 à 7.37.
  • Le harnais optimisé égale ou dépasse les modèles propriétaires, y compris Nano Banana Pro et GPT-Image-1.5.
  • Les résultats restent efficaces lors du changement du générateur, du nombre de références, du benchmark, de l'évaluateur ou du modèle de raisonnement sans réoptimisation.

Cette approche permet de découvrir des harnais performants qui généralisent à travers différentes configurations et benchmarks.