OpenAI выпустила SWE-bench Verified — проверенную человеком подвыборку бенчмарка SWE-bench, предназначенную для более надёжной оценки способности ИИ-моделей решать реальные программные задачи. Эта новая версия заменяет оригинальные наборы тестов SWE-bench и SWE-bench Lite, устраняя недостатки, которые ранее приводили к недооценке возможностей моделей.
В релиз включено 500 образцов, проверенных профессиональными разработчиками, чтобы обеспечить чётко сформулированные описания задач и правильно ограниченные по объёму модульные тесты. Также предоставлены аннотации ко всем 1 699 отобранным тестовым элементам, что позволяет разбивать сложность на подвыборки «лёгких» (196 задач) и «сложных» (45 задач). Дополнительно выпущена новая оценка с использованием контейнеризованных Docker-сред для повышения надёжности настройки.
На SWE-bench Verified GPT-4o решает 33,2% образцов, тогда как лучший открытый скелет Agentless удваивает свой предыдущий результат до 16%.