Модель Claude 3.5 Sonnet от Anthropic достигла 49% на бенчмарке SWE-bench Verified, превзойдя предыдущий рекордный результат в 45%. В статье подробно описывается система «агента», построенная вокруг модели для достижения этого результата.
- SWE-bench Verified — это подмножество из 500 решаемых задач по программной инженерии, используемое для оценки способности AI-агента решать задачи в GitHub-репозиториях на Python.
- Философия проектирования агента отдает приоритет контролю со стороны языковой модели при минимальном каркасе, используя только Bash Tool и Edit Tool.
- Система генерирует ответы до тех пор, пока модель не решит, что работа завершена, или не превысит длину контекста в 200k.
- Подробные описания инструментов были разработаны для предотвращения недопонимания, позволяя модели самостоятельно выбирать рабочий процесс, а не следовать жестко заданным шаблонам.
Этот подход помогает разработчикам оптимизировать использование Claude 3.5 Sonnet для сложных задач программирования, демонстрируя, как минимальный каркас может эффективно использовать возможности модели.