Benchmark · agentic

AgentBench

0 resultados 0 modelos

O AgentBench avalia LLMs como agentes interativos em 8 ambientes distintos (tarefas de código, de jogo e de web), medindo a tomada de decisão em múltiplos turnos; cada ambiente gera uma pontuação própria, combinadas em uma única Overall Score ponderada.

Saiba mais
Exemplo
Tarefa do ambiente «Sistema operacional»: dá-se ao agente um objetivo em linguagem natural (por exemplo, contar os arquivos que atendem a uma condição ou alterar as permissões de um arquivo) e ele digita comandos bash rodada após rodada, lê cada saída e então envia uma resposta final ou deixa o shell no estado exigido.
Pontuação
Cada ambiente usa sua própria métrica: taxa de sucesso (OS, DB, House-Holding), F1 (grafo de conhecimento), recompensa média (Web Shopping), precisão de passo/elemento (navegação web) ou progresso/recompensa de jogo (jogo de cartas, enigmas). A Overall Score principal é uma média ponderada das oito pontuações, com pesos escolhidos para equilibrar a dificuldade, de modo que nenhuma tarefa fácil domine.
Verificação
Cada tarefa roda em um ambiente executável com um verificador automático e determinístico: a trajetória de vários turnos do agente é validada por programa (por exemplo, um script que confere o shell, o estado final do banco de dados, a recompensa do WebShop ou a correspondência com as ações de referência). Não há juízes humanos; as interações têm um número máximo de rodadas, e ultrapassar o limite ou emitir uma ação inválida conta como falha.
Por que importa
Foi um dos primeiros benchmarks padronizados a testar LLMs como agentes, e não como respondedores de turno único, exercitando raciocínio de longo horizonte, uso de ferramentas e recuperação de erros; revelou uma grande diferença entre os principais modelos comerciais de API e os modelos de código aberto em tarefas agênticas reais.
Exemplo resolvido
Tarefa
Ambiente «Sistema operacional». Em um shell bash do Ubuntu, diz-se ao agente: «Quantas contas de usuário deste sistema têm /bin/bash como shell de login? Dê o número.» Ele pode executar vários comandos do shell ao longo de várias rodadas antes de responder.
Solução
grep -c ':/bin/bash$' /etc/passwd
Explicação
O sétimo campo (separado por dois-pontos) de cada linha de /etc/passwd é o shell de login, então contar as linhas terminadas em :/bin/bash dá o número de contas com bash; o agente lê esse número na saída do comando e o retorna pela ação answer(N) do ambiente. Correção: o verificador do OS roda um script de checagem e pontua o envio como sucesso/falha binário.

Ainda não há pontuações verificadas para este benchmark.