研究者らは、AutoRefを提案しました。これは、基盤モデルを凍結したまま、エージェントによるマルチリファレンス画像生成の実行ハーネスを自動的に最適化する手法です。コーディングエージェントは、被写体の省略や不自然な構成といった課題に対処するため、ハーネスコードを反復的に書き換えます。

  • システムはフィードバックタスクと選択タスクを分離し、トップランクのハーネスのビームを使用して検索を行います。
  • AutoRef-Harnessは、MultiBananaのホールドアウト4リファレンスタスクにおいて、オープンウェイトのFLUX.2 4Bモデルのスコアを5.72から7.37に向上させました。
  • 最適化されたハーネスは、Nano Banana ProやGPT-Image-1.5を含むプロプライエタリモデルと同等かそれ以上の性能を示します。
  • 生成器、参照数、ベンチマーク、評価者、または推論モデルを変更しても、再最適化なしで結果は有効です。

このアプローチにより、異なる構成やベンチマークに一般化する高性能なハーネスを発見することが可能になります。