Pesquisadores apresentam o Mid-Harness, um método que amostra e verifica ações candidatas na fronteira entre o modelo e o harness para melhorar a confiabilidade da execução em agentes de terminal. Esta abordagem aloca computação em tempo de teste verificando múltiplas opções antes de encaminhar uma para execução, mantendo o gerador e o harness inalterados.

  • No TerminalBench-Lite, usar um verificador GPT-5.6 Sol com 8 ações amostradas eleva o Pass@1 de 50,00% para 68,03% em comparação ao agente base.
  • Quando o TMAX-9B atua como verificador, a verificação por pares produz os melhores resultados entre os mecanismos avaliados.
  • A destilação de respostas de um verificador mais forte no TMAX-9B melhora ainda mais o Pass@1 sem alterar o gerador de ações.
  • Combinar o escalonamento de ações e trajetórias com o TMAX-9B alcança maior sucesso com menor custo estimado de tokens do que gerar apenas mais trajetórias.

Esses resultados identificam o escalonamento de ações como um alvo promissor para o escalonamento de computação em tempo de teste em agentes de terminal, melhorando o desempenho em modelos adicionais, benchmarks e harnesses.