Benchmark · agentic

Terminal-Bench

27 resultados 17 modelos

O Terminal-Bench avalia quão bem agentes de IA concluem tarefas reais de linha de comando em um terminal, como instalar software, depurar e realizar operações de sistema. A pontuação é a porcentagem de tarefas que o agente conclui com sucesso.

Saiba mais
Exemplo
Uma tarefa típica dá ao agente um ambiente quebrado ou vazio e pede que ele o leve a um estado funcional — por exemplo, instalar as dependências certas e corrigir a configuração para que um programa rode, tudo por meio de comandos do terminal.
Pontuação
Cada tarefa é avaliada como aprovada ou reprovada conforme o agente tenha atingido o estado final exigido, e a pontuação do benchmark é a porcentagem de tarefas resolvidas sobre o total.
Verificação
Um resultado só é aceito se verificações automáticas dentro de um ambiente isolado (sandbox) confirmarem que o objetivo pretendido da tarefa foi alcançado — não por votos humanos nem por correspondência exata de texto.
Por que importa
Habilidades de terminal — instalar, depurar e operar sistemas pela linha de comando — são centrais no trabalho real de engenharia, então este benchmark mostra se um agente consegue agir de forma autônoma e confiável em uma linha de comando de verdade. Sua versão 2.x, mais difícil, mantém a régua subindo à medida que os agentes melhoram.
Exemplo resolvido
Tarefa
Em um contêiner Docker do Terminal-Bench, o arquivo /app/access.log contém logs de acesso do Apache. Escreva um único comando que conte o número de endereços IP de cliente distintos (o primeiro campo separado por espaços de cada linha) e salve apenas esse número em /app/answer.txt.
Solução
awk '{print $1}' /app/access.log | sort -u | wc -l > /app/answer.txt
Explicação
awk imprime o primeiro campo (o IP do cliente) de cada linha do log, sort -u remove duplicatas e wc -l conta os IPs únicos restantes, redirecionando o resultado para /app/answer.txt. O Terminal-Bench avalia executando no contêiner um teste pytest que lê /app/answer.txt e verifica se é igual ao número conhecido de IPs únicos.
0 24.5 49 73.5 98 2025-05-22 2025-12-24 2026-07-29 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-23 Claude Sonnet 4 · 35.5 · 2025-05-23 GLM-4.6 · 40.5 · 2025-09-30 Claude Sonnet 4.5 · 50 · 2025-09-30 Claude Opus 4.5 · 59.3 · 2025-11-25 Claude Opus 4.6 · 65.4 · 2026-02-05 Composer 2 · 61.7 · 2026-03-27 GPT-5.6 Sol (ultra mode) · 91.9 · 2026-06-26 GPT-5.6 Sol · 88.8 · 2026-06-26 GLM-5.2 (753B MoE) · 70.8 · 2026-07-08 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 Kimi K2.6 · 73 · 2026-07-29 GPT-5.5 · 69 · 2026-07-29 Kimi K3 · 32 · 2026-07-29
Claude Opus 4 Claude Sonnet 4 GLM-4.6 Claude Sonnet 4.5 Claude Opus 4.5 Claude Opus 4.6 Composer 2 GPT-5.6 Sol (ultra mode) GPT-5.6 Sol GLM-5.2 (753B MoE) RELAI-VCL Meta Harness GEPA baseline agent Kimi K2.6 GPT-5.5 Kimi K3
Linha do tempo
Data Modelo Pontuação Fonte
2026-07-29 Kimi K2.6 73.0% Fireworks AI lança a camada de roteamento Fireworks Nexus para controle de custos
2026-07-29 GPT-5.5 69.0% Fireworks AI lança a camada de roteamento Fireworks Nexus para controle de custos
2026-07-29 Kimi K3 32.0% Fireworks AI lança a camada de roteamento Fireworks Nexus para controle de custos
2026-07-16 baseline agent 58.7% Otimização do RELAI-VCL obtém ganhos no Terminal-Bench 2.0
2026-07-16 Meta Harness 64.6% Otimização do RELAI-VCL obtém ganhos no Terminal-Bench 2.0
2026-07-16 GEPA 66.0% Otimização do RELAI-VCL obtém ganhos no Terminal-Bench 2.0
2026-07-16 RELAI-VCL 76.4% Otimização do RELAI-VCL obtém ganhos no Terminal-Bench 2.0
2026-07-16 Meta Harness 64.6% RELAI-VCL compõe ganhos de agente-otimizador via aprendizado contínuo
2026-07-16 RELAI-VCL 76.4% RELAI-VCL compõe ganhos de agente-otimizador via aprendizado contínuo
2026-07-16 GEPA 66.0% RELAI-VCL compõe ganhos de agente-otimizador via aprendizado contínuo
2026-07-16 baseline agent 58.7% RELAI-VCL compõe ganhos de agente-otimizador via aprendizado contínuo
2026-07-16 RELAI-VCL 76.4% RELAI-VCL compõe ganhos do agente-otimizador via aprendizado contínuo
2026-07-16 Meta Harness 64.6% RELAI-VCL compõe ganhos do agente-otimizador via aprendizado contínuo
2026-07-16 GEPA 66.0% RELAI-VCL compõe ganhos do agente-otimizador via aprendizado contínuo
2026-07-16 baseline agent 58.7% RELAI-VCL compõe ganhos do agente-otimizador via aprendizado contínuo
2026-07-08 GLM-5.2 (753B MoE) 70.8% GLM-5.2 em 4 bits em 4× DGX Spark atinge 70,8% no Terminal-Bench 2.1
2026-06-26 GPT-5.6 Sol (ultra mode) 91.9% OpenAI lança suavemente o GPT-5.6 Sol com recorde de codificação, mas reconhece problemas de trapaça
2026-06-26 GPT-5.6 Sol 88.8% OpenAI lança suavemente o GPT-5.6 Sol com recorde de codificação, mas reconhece problemas de trapaça
2026-03-27 Composer 2 61.7pts Cursor publica relatório técnico sobre o treinamento do modelo de codificação agêntica Composer 2
2026-02-05 Claude Opus 4.6 65.4% Anthropic lança Claude Opus 4.6 com janela de contexto de 1M e melhorias agênticas
2025-11-25 Claude Opus 4.5 59.3% Anthropic lança Claude Opus 4.5 com codificação e uso de computador de última geração
2025-09-30 GLM-4.6 40.5% Zhipu AI lança GLM-4.6 com capacidades agênticas e janela de contexto de 128k
2025-09-30 Claude Sonnet 4.5 50.0% Anthropic lança Claude Sonnet 4.5 com capacidades aprimoradas de codificação e agentes
2025-05-23 Claude Sonnet 4 35.5% Anthropic lança Claude Opus 4 e Sonnet 4 com raciocínio híbrido
2025-05-23 Claude Opus 4 43.2% Anthropic lança Claude Opus 4 e Sonnet 4 com raciocínio híbrido
2025-05-22 Claude Opus 4 43.2% Anthropic apresenta Claude Opus 4 e Sonnet 4 com pensamento estendido e uso de ferramentas
2025-05-22 Claude Opus 4 43.2% Anthropic lança Claude Opus 4 e Sonnet 4 com medidas de segurança ASL-3