O modelo atualizado Claude 3.5 Sonnet da Anthropic atingiu 49% no benchmark SWE-bench Verified, superando a pontuação anterior de estado da arte de 45%. O artigo detalha o sistema de "agente" construído em torno do modelo para alcançar esse resultado.
- O SWE-bench Verified é um subconjunto de 500 tarefas de engenharia de software resolúveis, usado para avaliar a capacidade de um agente de IA de resolver problemas no GitHub em repositórios Python.
- A filosofia de design do agente prioriza dar controle ao modelo de linguagem com mínimo suporte, usando apenas uma Bash Tool e uma Edit Tool.
- O sistema amostra respostas até que o modelo decida que terminou ou exceda seu comprimento de contexto de 200k.
- Descrições detalhadas das ferramentas foram elaboradas para evitar mal-entendidos, permitindo que o modelo escolha seu próprio fluxo de trabalho em vez de seguir padrões codificados.
Essa abordagem ajuda os desenvolvedores a otimizar o uso do Claude 3.5 Sonnet para tarefas complexas de programação, demonstrando como um suporte mínimo pode aproveitar eficazmente as capacidades do modelo.