Benchmark · agentic

SWE-bench Verified

86 resultados 59 modelos

Testa se um agente de IA consegue resolver issues reais do GitHub de ponta a ponta. O conjunto "Verified" reúne 500 tarefas validadas por humanos, retiradas de repositórios Python de código aberto populares.

Saiba mais
Exemplo
Dado um relatório de bug e o repositório, o modelo deve produzir um patch de código — por exemplo, corrigir uma função de parsing de datas que está falhando para que a suíte de testes do projeto passe.
Pontuação
% de issues resolvidos — normalmente reportado como pass@1 (uma tentativa). Quanto maior, melhor.
Verificação
Totalmente automático: o patch gerado é aplicado e os testes unitários ocultos reais do projeto rodam em um sandbox. Uma tarefa só conta se todos os testes-alvo passarem e nada regredir.
Por que importa
O principal benchmark de agentes de código no mundo real e um número de destaque em todo lançamento de fronteira; o progresso aqui mede o quão perto os agentes estão da engenharia de software autônoma.
Exemplo resolvido
Tarefa
Repositório django/django em um commit-base fixo. Relatório de bug: django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True) retorna '___this-is-a-test___', mas os underscores e hifens no início e no fim deveriam ser removidos, de modo que o resultado seja 'this-is-a-test'. O modelo recebe apenas o texto da issue mais o repositório e deve produzir um patch em formato unified diff.
Solução
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
     value = re.sub(r"[^\w\s-]", "", value.lower())
-    return re.sub(r"[-\s]+", "-", value)
+    return re.sub(r"[-\s]+", "-", value).strip("-_")
Explicação
slugify colapsa os separadores internos, mas nunca remove os -/_ das extremidades, então acrescentar .strip("-_") ao re.sub final os remove; o patch é mínimo e preserva todo o restante do comportamento. O SWE-bench Verified aplica o patch ao repositório no commit-base e avalia rodando a suíte oculta — só passa se todos os testes FAIL_TO_PASS passarem a verde enquanto todos os testes PASS_TO_PASS continuam verdes.
0 25 50 75 100 2024-08-13 2025-09-05 2026-09-29 Agentless · 32 · 2024-08-13 GPT‑4o · 33.2 · 2024-08-13 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-30 Claude 3.5 Sonnet · 49 · 2025-01-06 Claude 3.5 Haiku · 40.6 · 2024-10-22 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2026-03-25 GPT-4.5 · 38 · 2025-03-05 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-26 GPT-4.1 · 54.6 · 2025-04-14 GPT‑4.1 · 54.6 · 2025-04-14 o4-mini · 68.1 · 2025-04-17 Devstral · 46.8 · 2025-05-21 Claude Sonnet 4 · 72.7 · 2025-05-23 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-23 Deepseek-R1-0528 · 57.6 · 2025-05-30 Devstral Medium · 61.6 · 2025-07-10 Devstral Small 1.1 · 53.6 · 2025-07-10 Kimi K2-Instruct · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-28 Kimi K2 · 65.8 · 2025-07-28 GLM-4.5 · 64.2 · 2025-08-06 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT‑5 · 74.9 · 2025-08-07 Claude Sonnet 4.5 · 77.2 · 2025-09-29 Claude Sonnet 4.5 · 77.2 · 2025-09-30 Kimi K2 Thinking · 71.3 · 2025-11-07 Kimi K2 Thinking · 71.3 · 2025-11-19 GPT-5.1-Codex-Max · 77.9 · 2025-11-19 Devstral 2 · 72.2 · 2025-12-09 Devstral 2 · 72.2 · 2026-07-17 Devstral Small 2 · 68 · 2025-12-09 Devstral Small 2 · 68 · 2026-07-17 GPT-5.2 Thinking · 80 · 2025-12-11 GPT-5.2 Thinking · 80 · 2025-12-11 Qwen3.6-27B · 77.2 · 2026-01-28 Qwen3.6-27B · 77.2 · 2026-04-25 Qwen3.6-27B · 77.2 · 2026-08-10 Claude Opus 4.6 · 80.8 · 2026-02-01 Claude Opus 4.6 · 80.8 · 2026-02-05 MiniMax M2.5 · 80.2 · 2026-02-01 Claude Sonnet 4.6 · 79.6 · 2026-02-17 V4-Pro-Max · 80.6 · 2026-04-24 LLM-as-a-Verifier · 78.2 · 2026-07-07 Qwen3.5-35B-A3B · 6 · 2026-07-14 Qwen3-30B-A3B · 6 · 2026-07-14 DeepSeek V4 Pro · 80.6 · 2026-07-19 Claude Opus 5 · 96 · 2026-07-24 Inkling-Small · 80.2 · 2026-08-03 Orchard-SWE · 69.7 · 2026-08-03 Qwen3.5-27B · 74.8 · 2026-08-18 Ornith-1.5 · 86 · 2026-08-19 Ornith-1.5 · 86 · 2026-08-20 Qwen3.5-9B · 14.6 · 2026-08-20 Qwen3.5-9B · 16.6 · 2026-09-02 Granite 4.2 30B · 57 · 2026-08-26 Granite 4.2 8B · 47.7 · 2026-08-26 K2-Horizon-7B · 70.6 · 2026-09-07 K2-Horizon-3.7B · 68.6 · 2026-09-07 Qwen Test agent (post-trained) + Repair agent (post-trained) · 72.6 · 2026-09-09 Qwen Test agent (post-trained) · 62.2 · 2026-09-09 Qwen Test agent (post-trained) · 62.2 · 2026-09-09 GPT-5.6-sol (Test agent) · 65.3 · 2026-09-09 GPT-5.6-sol (Test agent) · 65.3 · 2026-09-09 base Repair agent (no-test baseline) · 61.2 · 2026-09-09 base Repair agent (no-test baseline) · 61.2 · 2026-09-09 base Test agent · 57.3 · 2026-09-09 Qwen Test agent + Repair agent (post-trained) · 72.6 · 2026-09-09 base Test agent (no-test baseline) · 57.3 · 2026-09-09 Ember-1 · 92.2 · 2026-09-28 Qwen3.5-4B (with ROFT) · 49.2 · 2026-09-29 Qwen3.8-Flash-Next Coder · 75.6 · 2026-09-29 Gemini 3.5 Flash · 79 · 2026-09-29 Claude 3.7 Sonnet · 62.3 · 2025-02-24 OpenAI o3 · 71.7 · 2025-04-16
Agentless GPT‑4o Claude 3.5 Sonnet Claude 3.5 Haiku o3 GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 o4-mini Devstral Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Devstral Medium Devstral Small 1.1 Kimi K2-Instruct Kimi K2 GLM-4.5 GPT-5 GPT‑5 Claude Sonnet 4.5 Kimi K2 Thinking GPT-5.1-Codex-Max Devstral 2 Devstral Small 2 GPT-5.2 Thinking Qwen3.6-27B Claude Opus 4.6 MiniMax M2.5 Claude Sonnet 4.6 V4-Pro-Max LLM-as-a-Verifier Qwen3.5-35B-A3B Qwen3-30B-A3B DeepSeek V4 Pro Claude Opus 5 Inkling-Small Orchard-SWE Qwen3.5-27B Ornith-1.5 Qwen3.5-9B Granite 4.2 30B Granite 4.2 8B K2-Horizon-7B K2-Horizon-3.7B Qwen Test agent (post-trained) + Repair agent (post-trained) Qwen Test agent (post-trained) GPT-5.6-sol (Test agent) base Repair agent (no-test baseline) base Test agent Qwen Test agent + Repair agent (post-trained) base Test agent (no-test baseline) Ember-1 Qwen3.5-4B (with ROFT) Qwen3.8-Flash-Next Coder Gemini 3.5 Flash Claude 3.7 Sonnet OpenAI o3
Linha do tempo
Data Modelo Pontuação Fonte
2026-09-29 Gemini 3.5 Flash 79.0% Google Research lança RRSI para evitar overfitting em harness de agentes de IA
2026-09-29 Qwen3.8-Flash-Next Coder 75.6% ISTA lança GGUFs GSQ-RCO para Qwen3.8-Flash-Next e compilação Coder com 50% de especialistas podados
2026-09-29 Qwen3.5-4B (with ROFT) 49.2% ROFT melhora modelos agênticos ajustando-os em explicações autogeradas
2026-09-28 Ember-1 92.2% Fireworks AI lança Ember-1, um Kimi K3 pós-treinado com 40% menos tokens
2026-09-09 Qwen Test agent + Repair agent (post-trained) 72.6% ExecCritic usa RL específico por função para melhorar agentes de codificação por reparo guiado por testes
2026-09-09 Qwen Test agent (post-trained) 62.2% ExecCritic usa RL específico por função para melhorar agentes de codificação por reparo guiado por testes
2026-09-09 GPT-5.6-sol (Test agent) 65.3% ExecCritic usa RL específico por função para melhorar agentes de codificação por reparo guiado por testes
2026-09-09 base Test agent (no-test baseline) 57.3% ExecCritic usa RL específico por função para melhorar agentes de codificação por reparo guiado por testes
2026-09-09 base Repair agent (no-test baseline) 61.2% ExecCritic usa RL específico por função para melhorar agentes de codificação por reparo guiado por testes
2026-09-09 Qwen Test agent (post-trained) + Repair agent (post-trained) 72.6% ExecCritic usa RL específico por função para melhorar agentes de codificação por meio de reparo guiado por testes
2026-09-09 Qwen Test agent (post-trained) 62.2% ExecCritic usa RL específico por função para melhorar agentes de codificação por meio de reparo guiado por testes
2026-09-09 GPT-5.6-sol (Test agent) 65.3% ExecCritic usa RL específico por função para melhorar agentes de codificação por meio de reparo guiado por testes
2026-09-09 base Repair agent (no-test baseline) 61.2% ExecCritic usa RL específico por função para melhorar agentes de codificação por meio de reparo guiado por testes
2026-09-09 base Test agent 57.3% ExecCritic usa RL específico por função para melhorar agentes de codificação por meio de reparo guiado por testes
2026-09-07 K2-Horizon-7B 70.6% IFM lança K2 Horizon: seis modelos Apache 2.0 de 0,9B a 375B
2026-09-07 K2-Horizon-3.7B 68.6% IFM lança K2 Horizon: seis modelos Apache 2.0 de 0,9B a 375B
2026-09-02 Qwen3.5-9B 16.6% CANOPY permite que Qwen3-14B domine o AppWorld usando apenas RL de resultado
2026-08-26 Granite 4.2 30B 57.0% IBM lança Granite 4.2 com raciocínio nativo e RL agêntico para modelos empresariais abertos
2026-08-26 Granite 4.2 8B 47.67% IBM lança Granite 4.2 com raciocínio nativo e RL agêntico para modelos empresariais abertos
2026-08-20 Qwen3.5-9B 14.6% Meta lança Muse Video com áudio nativo; Stripe adquire OpenRouter
2026-08-20 Ornith-1.5 86.0% Z.ai propõe lei de escala pós-treinamento e lança GLM 5.3; Ornith-1.5 inicia com autoaperfeiçoamento
2026-08-19 Ornith-1.5 86.0% Ornith-1.5 lança modelos de 9B, 35B-A3B e 397B com treinamento de autoaperfeiçoamento
2026-08-18 Qwen3.5-27B 74.8% Agente Kozuchi resolve 374 instâncias do SWE-bench Verified usando Qwen3.5-27B
2026-08-10 Qwen3.6-27B 77.2% Meta lança Muse Glimmer, um modelo agêntico de pesos abertos com 30B que roda em uma GPU de consumo
2026-08-03 Orchard-SWE 69.7% Microsoft Research lança o framework Orchard para IA agente escalável
2026-08-03 Inkling-Small 80.2% Thinking Machines Lab lança Inkling-Small, um modelo MoE multimodal de pesos abertos com 276B
2026-07-24 Claude Opus 5 96.0% Anthropic lança Claude Opus 5 com raciocínio padrão e ganhos em codificação agêntica
2026-07-19 DeepSeek V4 Pro 80.6% Kimi K3, DeepSeek V4 Pro e GLM-5.2 comparados em benchmarks, licença e custo de serviço
2026-07-17 Devstral 2 72.2% Mistral Vibe for Code lidera quatro agentes de codificação na tarefa de scaffold para PR
2026-07-17 Devstral Small 2 68.0% Mistral Vibe for Code lidera quatro agentes de codificação na tarefa de scaffold para PR
2026-07-14 Qwen3.5-35B-A3B 6.0% UMoE realinha pools de especialistas MoE para ajuste fino específico de domínio aprimorado
2026-07-14 Qwen3-30B-A3B 6.0% UMoE realinha pools de especialistas MoE para ajuste fino específico de domínio aprimorado
2026-07-07 LLM-as-a-Verifier 78.2% LLM-as-a-Verifier apresenta framework de verificação de propósito geral com pontuação contínua
2026-04-25 Qwen3.6-27B 77.2% Alibaba lança Qwen3.6-27B, superando predecessor maior em benchmarks de codificação
2026-04-24 V4-Pro-Max 80.6% DeepSeek lança V4 com arquitetura eficiente de contexto longo para agentes
2026-03-25 o3 71.7% OpenAI anuncia a aposentadoria do o3 do ChatGPT e compartilha pontuações de benchmarks
2026-02-17 Claude Sonnet 4.6 79.6% Anthropic lança Claude Sonnet 4.6 com melhorias em codificação, uso de computador e contexto de 1M de tokens
2026-02-05 Claude Opus 4.6 80.8% Anthropic lança Claude Opus 4.6 com janela de contexto de 1M e melhorias agênticas
2026-02-01 Claude Opus 4.6 80.8% Benchmarks descontaminados revelam lacuna de 12 pontos entre os principais modelos de codificação de IA
2026-02-01 MiniMax M2.5 80.2% Benchmarks descontaminados revelam lacuna de 12 pontos entre os principais modelos de codificação de IA
2026-01-28 Qwen3.6-27B 77.2% Qwen 3.6-27B e DeepSeek V4 Flash lideram benchmarks de codificação local
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI lança GPT-5.2, superando Gemini 3 em benchmarks de codificação e raciocínio
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI apresenta GPT-5.2 com capacidades de ponta para trabalho profissional do conhecimento
2025-12-09 Devstral 2 72.2% Mistral lança modelos de codificação Devstral 2 e Mistral Vibe CLI
2025-12-09 Devstral Small 2 68.0% Mistral lança modelos de codificação Devstral 2 e Mistral Vibe CLI
2025-11-19 GPT-5.1-Codex-Max 77.9% OpenAI torna o GPT-5.1-Codex-Max o padrão no Codex CLI
2025-11-19 Kimi K2 Thinking 71.3% Moonshot AI lança Kimi K2 Thinking com uso de ferramentas agênticas
2025-11-07 Kimi K2 Thinking 71.3% Moonshot AI lança Kimi K2 Thinking, um modelo de raciocínio open-source com 1T parâmetros
2025-09-30 Claude Sonnet 4.5 77.2% Anthropic lança Claude Sonnet 4.5 com capacidades aprimoradas de codificação e agentes
2025-09-29 Claude Sonnet 4.5 77.2% Anthropic
2025-08-07 GPT-5 74.9% OpenAI lança GPT-5 unificado com roteamento em tempo real e acesso gratuito
2025-08-07 GPT‑5 74.9% OpenAI lança API do GPT-5 com melhorias em codificação e agentes
2025-08-07 GPT-5 74.9% OpenAI apresenta GPT-5 com roteamento unificado e raciocínio de nível especialista
2025-08-07 GPT-5 74.9% OpenAI lança GPT-5 com raciocínio adaptativo e arquitetura unificada
2025-08-07 GPT-5 74.9% OpenAI
2025-08-06 GLM-4.5 64.2% Zhipu AI lança modelos GLM-4.5 que igualam Claude e DeepSeek
2025-07-28 Kimi K2 65.8% Moonshot lança Kimi K2, um modelo MoE agêntico aberto com 32B de parâmetros ativados
2025-07-28 Kimi K2 65.8% Kimi K2: modelo MoE aberto com 1T de parâmetros e otimizador MuonClip
2025-07-11 Kimi K2-Instruct 65.8% Moonshot AI lança Kimi-K2-Instruct, um modelo MoE de 1T parâmetros com capacidades agênticas
2025-07-11 Kimi K2 65.8% Moonshot AI lança Kimi K2, um modelo MoE de 1T parâmetros com capacidades agênticas
2025-07-10 Devstral Medium 61.6% Mistral AI lança Devstral Small 1.1 e Devstral Medium com All Hands AI
2025-07-10 Devstral Small 1.1 53.6% Mistral AI lança Devstral Small 1.1 e Devstral Medium com All Hands AI
2025-05-30 Deepseek-R1-0528 57.6% DeepSeek atualiza modelo R1 com raciocínio aprimorado e melhores pontuações em benchmarks
2025-05-23 Claude Sonnet 4 72.7% Anthropic lança Claude Opus 4 e Sonnet 4 com raciocínio híbrido
2025-05-23 Claude Opus 4 72.5% Anthropic lança Claude Opus 4 e Sonnet 4 com raciocínio híbrido
2025-05-22 Claude Opus 4 72.5% Anthropic
2025-05-21 Devstral 46.8% Mistral AI lança Devstral, LLM agêntico para engenharia de software
2025-04-17 o4-mini 68.1% OpenAI lança o4-mini, um modelo de raciocínio multimodal mais rápido e barato
2025-04-16 OpenAI o3 71.7% OpenAI
2025-04-14 GPT-4.1 54.6% OpenAI lança família GPT-4.1 com contexto de 1M de tokens e melhorias em codificação
2025-04-14 GPT‑4.1 54.6% OpenAI lança GPT-4.1, GPT-4.1 mini e GPT-4.1 nano na API
2025-03-26 Gemini 2.5 Pro 63.8% Google lança modelo de raciocínio experimental Gemini 2.5 Pro com contexto de 1M tokens
2025-03-25 Gemini 2.5 Pro 63.8% Google apresenta o modelo experimental Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 63.8% Google apresenta o modelo de raciocínio Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 63.8% Google DeepMind
2025-03-05 GPT-4.5 38.0% OpenAI lança GPT-4.5, seu maior modelo, para o ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 62.3% Anthropic
2025-01-06 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet alcança 49% no SWE-bench Verified
2024-12-20 o3 71.7% OpenAI lança modelo o3 com alto desempenho em raciocínio e programação
2024-12-20 o3 71.7% OpenAI antecipa modelo de raciocínio o3 com avanços no ARC AGI e Frontier Math
2024-10-30 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet alcança 49% no SWE-bench Verified com mínimo suporte de agente
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic atualiza Claude 3.5 Sonnet, lança Claude 3.5 Haiku e versão beta de uso do computador
2024-10-22 Claude 3.5 Haiku 40.6% Anthropic atualiza Claude 3.5 Sonnet, lança Claude 3.5 Haiku e versão beta de uso do computador
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic
2024-08-13 Agentless 32.0% OpenAI lança o SWE-bench Verified com subconjunto validado por humanos
2024-08-13 GPT‑4o 33.2% OpenAI lança o SWE-bench Verified com subconjunto validado por humanos