Anthropic升级后的Claude 3.5 Sonnet模型在SWE-bench Verified基准测试中达到49%的得分,超越了此前45%的最先进成绩。文章详细介绍了为实现这一结果而围绕该模型构建的“智能体”系统。

  • SWE-bench Verified是一个包含500个可解决软件工程任务的子集,用于评估AI智能体在Python仓库中解决GitHub问题的能力。
  • 该智能体的设计理念优先考虑将控制权交给语言模型,并采用最少的框架支持,仅使用Bash Tool和Edit Tool。
  • 系统会持续采样响应,直到模型判断任务完成或超出其200k上下文长度限制。
  • 精心设计了详细的工具描述以防止误解,使模型能够自主选择工作流程,而非遵循硬编码的模式。

这种方法通过展示极少的框架如何有效利用模型能力,帮助开发者优化其在复杂编码任务中对Claude 3.5 Sonnet的使用。