AnthropicのアップグレードされたClaude 3.5 Sonnetモデルは、SWE-bench Verifiedベンチマークで49%に到達し、以前の最先端スコアである45%を上回りました。この記事では、この結果を達成するためにモデルの周りに構築された「エージェント」システムの詳細が説明されています。

  • SWE-bench Verifiedは、AIエージェントがPythonリポジトリのGitHubの問題を解決する能力を評価するために使用される、解決可能な500件のソフトウェアエンジニアリングタスクの部分集合です。
  • エージェントの設計哲学は、最小限の支援で言語モデルに制御を与えることを優先し、Bash ToolとEdit Toolのみを使用しています。
  • システムは、モデルが完了したと判断するか、200kのコンテキスト長を超えるまで応答をサンプリングします。
  • 誤解を防ぐために詳細なツール説明が作成され、モデルがハードコードされたパターンに従うのではなく独自のワークフローを選択できるようになりました。

このアプローチは、最小限の支援がいかに効果的にモデルの能力を活用できるかを示すことで、開発者が複雑なコーディングタスクにおいてClaude 3.5 Sonnetの使用を最適化するのに役立ちます。