A OpenAI lançou o SWE-bench Verified, um subconjunto validado por humanos do benchmark SWE-bench, projetado para avaliar de forma mais confiável a capacidade dos modelos de IA de resolver problemas reais de software. Esta nova versão substitui os conjuntos de teste originais SWE-bench e SWE-bench Lite ao corrigir falhas que anteriormente levavam à subestimação das capacidades dos modelos.
O lançamento inclui 500 amostras verificadas por desenvolvedores profissionais para garantir descrições de problemas bem especificadas e testes de unidade com escopo adequado. Também fornece anotações para todos os 1.699 itens de teste amostrados, permitindo a divisão da dificuldade em subconjuntos 'fáceis' (196 tarefas) e 'difíceis' (45 tarefas). Além disso, é lançado um novo sistema de avaliação que utiliza ambientes Docker em contêineres para melhorar a confiabilidade da configuração.
No SWE-bench Verified, o GPT-4o resolve 33,2% das amostras, enquanto o melhor scaffold de código aberto, Agentless, dobra sua pontuação anterior para 16%.