論文では、現実のソフトウェアエンジニアリングタスクにおける言語モデルの能力をテストするために設計された評価フレームワークであるSWE-benchを紹介しています。これは、12の人気のPythonリポジトリからの実際のGitHub課題とプルリクエストから抽出された2,294の問題で構成されています。

  • ベンチマークでは、モデルが特定の課題を解決するためにコードベースを編集する必要があり、多くの場合、複数の関数、クラス、ファイルにわたる調整が必要です。
  • モデルは実行環境と対話し、非常に長いコンテキストを処理し、従来のコード生成を超えた複雑な推論を行う必要があります。
  • 評価結果によると、最先端の独自モデルでさえ大幅に苦労しており、最良のパフォーマンスを示したClaude 2は課題のわずか1.96%しか解決できませんでした。
  • ファインチューニングされたSWE-Llamaも、データセット内の最も簡単な課題のみを解決しました。

SWE-benchでの進歩は、現実のシナリオで言語モデルをより実用的で知的かつ自律的にするための一歩と見なされています。