El modelo mejorado Claude 3.5 Sonnet de Anthropic alcanzó el 49% en la prueba SWE-bench Verified, superando la puntuación anterior más alta de 45%. El artículo detalla el sistema de "agente" construido alrededor del modelo para lograr este resultado.

  • SWE-bench Verified es un subconjunto de 500 tareas de ingeniería de software resolubles utilizadas para evaluar la capacidad de un agente de IA para resolver problemas de GitHub en repositorios de Python.
  • La filosofía de diseño del agente prioriza dar control al modelo de lenguaje con andamiaje mínimo, utilizando solo una Herramienta Bash y una Herramienta de Edición.
  • El sistema muestrea respuestas hasta que el modelo decide que ha terminado o excede su longitud de contexto de 200k.
  • Se elaboraron descripciones detalladas de las herramientas para evitar malentendidos, permitiendo que el modelo elija su propio flujo de trabajo en lugar de seguir patrones codificados.

Este enfoque ayuda a los desarrolladores a optimizar su uso de Claude 3.5 Sonnet para tareas de codificación complejas al demostrar cómo el andamiaje mínimo puede aprovechar eficazmente las capacidades del modelo.