В статье представлен SWE-bench, система оценки, предназначенная для проверки возможностей языковых моделей в задачах реальной инженерии программного обеспечения. Она состоит из 2 294 проблем, взятых из реальных задач и pull-реквестов на GitHub в 12 популярных Python-репозиториях.

  • Для прохождения бенчмарка модели должны редактировать кодовую базу для решения конкретных проблем, что часто требует координации между множеством функций, классов и файлов.
  • Модели должны взаимодействовать с исполняющими средами, обрабатывать чрезвычайно длинные контексты и выполнять сложный вывод, выходящий за рамки традиционной генерации кода.
  • Результаты оценки показывают, что даже самые современные проприетарные модели испытывают значительные трудности; лучшая модель, Claude 2, решила лишь 1,96% проблем.
  • Моделированная модель SWE-Llama также смогла решить только самые простые проблемы в наборе данных.

Прогресс на SWE-bench считается шагом к тому, чтобы сделать языковые модели более практичными, интеллектуальными и автономными в реальных сценариях.