A Anthropic relata que seu modelo atualizado Claude 3.5 Sonnet obteve uma pontuação de 49% no benchmark SWE-bench Verified, superando a pontuação anterior de estado da arte de 45%. O artigo detalha o sistema de "agente" construído em torno do modelo para ajudar os desenvolvedores a otimizar o desempenho.

  • O SWE-bench Verified é um subconjunto de 500 tarefas de engenharia de software revisadas que testam a capacidade de um modelo de resolver issues do GitHub em repositórios Python.
  • A filosofia de design do agente prioriza dar controle ao modelo de linguagem com o mínimo de estruturação, usando ferramentas Bash e Edit.
  • As descrições das ferramentas foram refinadas para evitar mal-entendidos, como exigir caminhos absolutos para evitar erros ao mover diretórios.
  • O sistema amostra até que o modelo decida que terminou ou exceda seu comprimento de contexto de 200k.

O post visa ajudar os desenvolvedores a entender a arquitetura do agente para obter o melhor desempenho possível do Claude 3.5 Sonnet em tarefas de codificação.