Mid-Harness melhora a confiabilidade da ação de agentes de terminal por meio do escalonamento de computação em tempo de teste
Pesquisadores apresentam o Mid-Harness, um método que amostra e verifica ações candidatas na fronteira entre o modelo e o harness para melhorar a confiabilidade da execução em agentes de terminal. Esta abordagem aloca computação em tempo de teste verificando múltiplas opções antes de encaminhar uma para execução, mantendo o gerador e o harness inalterados.