Anthropicは、アップグレードされたClaude 3.5 SonnetモデルがSWE-bench Verifiedベンチマークで49%のスコアを達成し、以前の最先端スコアである45%を上回ったと報告しました。記事では、開発者のパフォーマンス最適化を支援するためにモデルを中心に構築された「エージェント」システムの詳細が説明されています。

  • SWE-bench Verifiedは、PythonリポジトリでのGitHubの問題を解決するモデルの能力をテストする、レビュー済みの500件のソフトウェアエンジニアリングタスクの部分集合です。
  • エージェントの設計哲学は、最小限の支援構造で言語モデルに制御を与えることを優先し、BashおよびEditツールを使用します。
  • ディレクトリ移動時のエラーを避けるために絶対パスを必要とするなど、誤解を防ぐためにツールの説明が refinement されました。
  • システムは、モデルが完了したと判断するか、200kのコンテキスト長を超えるまでサンプリングを行います。

この投稿は、開発者がコーディングタスクにおいてClaude 3.5 Sonnetから最高のパフォーマンスを引き出すためのエージェントアーキテクチャを理解するのに役立てることを目的としています。