Benchmark · agentic

SWE-rebench

12 resultados 12 modelos

SWE-rebench é uma variante continuamente atualizada do benchmark de programação SWE-bench que retira tarefas de issues recentes do GitHub para reduzir a chance de o modelo já tê-las visto durante o treinamento. Ele reporta a porcentagem de tarefas de engenharia de software que o modelo resolve (% resolved).

Saiba mais
Exemplo
Um item típico entrega ao modelo um relatório de bug ou pedido de funcionalidade real de um repositório do GitHub, e ele precisa editar o código do projeto para resolver o problema.
Pontuação
A métrica é % resolved: o número de tarefas que o modelo corrige dividido pelo total de tarefas, expresso em porcentagem.
Verificação
Uma solução é aceita automaticamente quando a própria suíte de testes do repositório passa no código corrigido — a correção precisa deixar verdes os testes que falhavam sem quebrar os demais.
Por que importa
Como suas tarefas são renovadas a partir de issues recentes, ele oferece uma leitura mais limpa da real habilidade de programação, mais difícil de inflar decorando dados antigos e públicos de benchmarks.
Exemplo resolvido
Tarefa
Instância do SWE-rebench criada a partir de um repositório Python real do GitHub (python-slugify), fixado em um commit base. Problema: slugify('Hello, World!') retorna 'hello--world' — separadores consecutivos geram um hífen duplicado em vez de um só, mas o slug esperado é 'hello-world'. Entrega: um patch git-diff sobre o snapshot do repositório que faça o teste FAIL_TO_PASS passar mantendo todos os testes PASS_TO_PASS verdes.
Solução
--- a/slugify/slugify.py
+++ b/slugify/slugify.py
@@ def slugify(text):
     text = re.sub(r"[^\w\s-]", "", text).strip().lower()
-    return re.sub(r"[\s]+", "-", text)
+    text = re.sub(r"[\s]+", "-", text)
+    return re.sub(r"-{2,}", "-", text)
Explicação
O gerador de slug reduz os espaços a - mas nunca elimina hífens repetidos, então vários separadores vazam; adicionar re.sub(r'-{2,}', '-', text) os normaliza para um único -. O SWE-rebench avalia por execução: aplica o patch no contêiner do repositório e marca a instância como resolvida só se o teste FAIL_TO_PASS agora passar e todos os testes PASS_TO_PASS continuarem passando (ranking = % resolvidas).
0 15 30 45 60 2026-02-01 2026-04-19 2026-07-05 MiniMax M2.5 · 39.6 · 2026-02-01 Claude Opus 4.6 · 51.7 · 2026-02-01 Claude Opus 4.8 xhigh · 56.5 · 2026-07-05 GLM-5.2 · 51.1 · 2026-07-05 Gemini 3.5 Flash · 49.5 · 2026-07-05 MiniMax M3 · 45.6 · 2026-07-05 DeepSeek-V4 Pro · 42.7 · 2026-07-05 MiMo V2.5 Pro · 42.4 · 2026-07-05 DeepSeek-V4 Flash · 38.4 · 2026-07-05 Qwen3.6-27B · 36.5 · 2026-07-05 Qwen3.6-35B-A3B · 33.8 · 2026-07-05 Gemma 4 31B · 16.5 · 2026-07-05
MiniMax M2.5 Claude Opus 4.6 Claude Opus 4.8 xhigh GLM-5.2 Gemini 3.5 Flash MiniMax M3 DeepSeek-V4 Pro MiMo V2.5 Pro DeepSeek-V4 Flash Qwen3.6-27B Qwen3.6-35B-A3B Gemma 4 31B
Linha do tempo
Data Modelo Pontuação Fonte
2026-07-05 Claude Opus 4.8 xhigh 56.5% Ranking SWE-rebench adiciona GLM-5.2, Qwen3.6, Gemma 4 e melhora a interface
2026-07-05 GLM-5.2 51.1% Ranking SWE-rebench adiciona GLM-5.2, Qwen3.6, Gemma 4 e melhora a interface
2026-07-05 Gemini 3.5 Flash 49.5% Ranking SWE-rebench adiciona GLM-5.2, Qwen3.6, Gemma 4 e melhora a interface
2026-07-05 MiniMax M3 45.6% Ranking SWE-rebench adiciona GLM-5.2, Qwen3.6, Gemma 4 e melhora a interface
2026-07-05 DeepSeek-V4 Pro 42.7% Ranking SWE-rebench adiciona GLM-5.2, Qwen3.6, Gemma 4 e melhora a interface
2026-07-05 MiMo V2.5 Pro 42.4% Ranking SWE-rebench adiciona GLM-5.2, Qwen3.6, Gemma 4 e melhora a interface
2026-07-05 DeepSeek-V4 Flash 38.4% Ranking SWE-rebench adiciona GLM-5.2, Qwen3.6, Gemma 4 e melhora a interface
2026-07-05 Qwen3.6-27B 36.5% Ranking SWE-rebench adiciona GLM-5.2, Qwen3.6, Gemma 4 e melhora a interface
2026-07-05 Qwen3.6-35B-A3B 33.8% Ranking SWE-rebench adiciona GLM-5.2, Qwen3.6, Gemma 4 e melhora a interface
2026-07-05 Gemma 4 31B 16.5% Ranking SWE-rebench adiciona GLM-5.2, Qwen3.6, Gemma 4 e melhora a interface
2026-02-01 MiniMax M2.5 39.6% Benchmarks descontaminados revelam lacuna de 12 pontos entre os principais modelos de codificação de IA
2026-02-01 Claude Opus 4.6 51.7% Benchmarks descontaminados revelam lacuna de 12 pontos entre os principais modelos de codificação de IA