Anthropic 报告称,其升级后的 Claude 3.5 Sonnet 模型在 SWE-bench Verified 基准测试中取得了 49% 的成绩,超越了此前 45% 的最先进成绩。文章详细介绍了围绕该模型构建的“代理”系统,以帮助开发人员优化性能。

  • SWE-bench Verified 是 500 个经过审查的软件工程任务的子集,用于测试模型在 Python 仓库中解决 GitHub 问题的能力。
  • 代理的设计哲学优先考虑以最小的支撑结构将控制权交给语言模型,使用 Bash 和 Edit 工具。
  • 对工具描述进行了优化以防止误解,例如要求使用绝对路径以避免在移动目录时出错。
  • 系统会持续采样,直到模型决定完成或超过其 200k 上下文长度。

这篇文章旨在帮助开发人员理解代理架构,从而在编码任务中获得 Claude 3.5 Sonnet 的最佳性能。