Les auteurs présentent WebMRE, un benchmark hors ligne de 541 tâches et 5 293 étapes dérivés de trajectoires WebArena réussies, conçu pour fournir un protocole déterministe d'évaluation des points de contrôle des agents web sans dérive de l'environnement. Ce cadre associe des phrases-guide orientées humain à des actions ancrées afin d'étudier l'effet de renforcement mutuel entre elles.

  • Le décodage conjoint d'un guide améliore la sélection des éléments de 0,9 et 0,2 points pour Qwen3.5-4B, et de 1,7 et 2,2 points pour Qwen3.5-9B.
  • L'analyse de médiation confirme que le guide agit comme un canal causal : forcer le guide idéal comme préfixe de décodage augmente la précision des actions de 0,422 à 0,684.
  • Les modèles affinés surpassent GPT-5.5, Claude Opus 4.8 et Gemini 3.5 Flash dans les métriques hors ligne en zéro-shot.

L'étude démontre que les guides portent un sens d'instruction plutôt que de simples chaînes d'étiquettes, offrant une méthode reproductible pour évaluer les phénomènes d'entraînement des agents web.