Anthropic의 업그레이드된 Claude 3.5 Sonnet 모델은 SWE-bench Verified 벤치마크에서 49%를 기록하며 이전 최고 점수인 45%를 뛰어넘었습니다. 이 기사는 이 결과를 달성하기 위해 모델 주변에 구축된 "에이전트" 시스템에 대해 자세히 설명합니다.

  • SWE-bench Verified는 Python 저장소의 GitHub 이슈를 해결하는 AI 에이전트의 능력을 평가하기 위해 사용되는 500개의 해결 가능한 소프트웨어 엔지니어링 작업의 하위 집합입니다.
  • 에이전트 설계 철학은 Bash Tool과 Edit Tool만 사용하여 최소한의 구조로 언어 모델에 제어를 우선시합니다.
  • 시스템은 모델이 작업을 완료했다고 판단하거나 200k 컨텍스트 길이를 초과할 때까지 응답을 샘플링합니다.
  • 오해를 방지하기 위해 상세한 도구 설명이 작성되었으며, 이를 통해 모델은 고정된 패턴을 따르는 대신 자체 워크플로우를 선택할 수 있습니다.

이 접근 방식은 최소한의 구조가 모델의 능력을 효과적으로 활용할 수 있음을 보여줌으로써 개발자가 Claude 3.5 Sonnet을 복잡한 코딩 작업에 최적화하는 데 도움이 됩니다.