OpenAI发布了SWE-bench Verified,这是SWE-bench基准测试中经过人工验证的子集,旨在更可靠地评估AI模型解决现实世界软件问题的能力。新版本通过纠正此前导致低估模型能力的缺陷,取代了原始的SWE-bench和SWE-bench Lite测试集。
此次发布包含由专业开发人员验证的500个样本,以确保问题描述明确且单元测试范围适当。同时提供了所有1,699个采样测试项的标注,支持将难度划分为“简单”(196个任务)和“困难”(45个任务)子集。此外,还发布了基于容器化Docker环境的新评估框架,以提高设置可靠性。
在SWE-bench Verified上,GPT-4o解决了33.2%的样本,而最佳开源框架Agentless将其之前的得分翻倍至16%。