Os autores apresentam o WebMRE, um benchmark offline com 541 tarefas e 5.293 passos derivados de trajetórias bem-sucedidas do WebArena, projetado para fornecer um protocolo determinístico para pontuar checkpoints de agentes web sem deriva do ambiente. Este framework combina frases-guia orientadas ao humano com ações fundamentadas para estudar o efeito de reforço mútuo entre elas.

  • A decodização conjunta de um guia eleva a seleção de elementos em 0,9 e 0,2 pontos para Qwen3.5-4B, e em 1,7 e 2,2 pontos para Qwen3.5-9B.
  • A análise de mediação confirma que o guia atua como um canal causal: forçar o guia verdadeiro como prefixo de decodização eleva a precisão da ação de .422 para .684.
  • Modelos ajustados superam GPT-5.5, Claude Opus 4.8 e Gemini 3.5 Flash nas métricas offline zero-shot.

O estudo demonstra que os guias carregam significado instrucional em vez de apenas strings de rótulo, oferecendo um método reproduzível para avaliar fenômenos de treinamento em agentes web.