Anthropic сообщает, что её обновлённая модель Claude 3.5 Sonnet набрала 49% баллов на бенчмарке SWE-bench Verified, превзойдя предыдущий результат в 45%. В статье подробно описывается система «агента», построенная вокруг модели для помощи разработчикам в оптимизации производительности.
- SWE-bench Verified — это подмножество из 500 проверенных задач по разработке программного обеспечения, которые проверяют способность модели решать задачи GitHub в репозиториях Python.
- Философия дизайна агента отдаёт приоритет предоставлению контроля языковой модели при минимальном количестве вспомогательных структур, используя инструменты Bash и Edit.
- Описания инструментов были уточнены для предотвращения недоразумений, таких как требование абсолютных путей для избежания ошибок при перемещении директорий.
- Система делает выборки до тех пор, пока модель не решит, что завершена, или не превысит длину контекста в 200k токенов.
Публикация призвана помочь разработчикам понять архитектуру агента, чтобы получить наилучшую производительность от Claude 3.5 Sonnet при выполнении задач по программированию.