Pesquisadores apresentam o Mid-Harness, um método que amostra e verifica ações candidatas na fronteira entre o modelo e o harness para melhorar a confiabilidade da execução em agentes de terminal. Esta abordagem aloca computação em tempo de teste verificando múltiplas opções antes de encaminhar uma para execução, mantendo o gerador e o harness inalterados.
- No TerminalBench-Lite, usar um verificador GPT-5.6 Sol com 8 ações amostradas eleva o Pass@1 de 50,00% para 68,03% em comparação ao agente base.
- Quando o TMAX-9B atua como verificador, a verificação por pares produz os melhores resultados entre os mecanismos avaliados.
- A destilação de respostas de um verificador mais forte no TMAX-9B melhora ainda mais o Pass@1 sem alterar o gerador de ações.
- Combinar o escalonamento de ações e trajetórias com o TMAX-9B alcança maior sucesso com menor custo estimado de tokens do que gerar apenas mais trajetórias.
Esses resultados identificam o escalonamento de ações como um alvo promissor para o escalonamento de computação em tempo de teste em agentes de terminal, melhorando o desempenho em modelos adicionais, benchmarks e harnesses.