Anthropic informa que su modelo mejorado Claude 3.5 Sonnet logró una puntuación del 49% en la prueba de referencia SWE-bench Verified, superando la puntuación anterior de estado del arte del 45%. El artículo detalla el sistema de "agente" construido alrededor del modelo para ayudar a los desarrolladores a optimizar el rendimiento.

  • SWE-bench Verified es un subconjunto de 500 tareas de ingeniería de software revisadas que prueban la capacidad de un modelo para resolver problemas de GitHub en repositorios de Python.
  • La filosofía de diseño del agente prioriza dar control al modelo de lenguaje con el mínimo andamiaje, utilizando herramientas Bash y Edit.
  • Las descripciones de las herramientas se refinaron para evitar malentendidos, como requerir rutas absolutas para evitar errores al mover directorios.
  • El sistema muestrea hasta que el modelo decide que ha terminado o excede su longitud de contexto de 200k.

El artículo tiene como objetivo ayudar a los desarrolladores a comprender la arquitectura del agente para obtener el mejor rendimiento posible de Claude 3.5 Sonnet en tareas de codificación.