该论文介绍了 SWE-bench,这是一个旨在测试语言模型在现实软件工程任务中能力的评估框架。它包含从 12 个流行的 Python 仓库中的实际 GitHub 问题和拉取请求中提取的 2,294 个问题。

  • 该基准测试要求模型编辑代码库以解决特定问题,通常涉及跨多个函数、类和文件的协调。
  • 模型必须与执行环境交互,处理极长的上下文,并执行超越传统代码生成的复杂推理。
  • 评估结果显示,即使是最先进的专有模型也面临显著困难;表现最好的模型 Claude 2 仅解决了 1.96% 的问题。
  • 微调模型 SWE-Llama 也仅解决了数据集中最简单的问题。

在 SWE-bench 上的进步被视为使语言模型在现实场景中更实用、更智能和更自主的步骤。