Anthropic은 업그레이드된 Claude 3.5 Sonnet 모델이 SWE-bench Verified 벤치마크에서 49점의 점수를 달성하여 이전 최첨단 점수인 45점을 넘어섰다고 보고했습니다. 기사는 개발자가 성능을 최적화할 수 있도록 모델 주변에 구축된 "에이전트" 시스템에 대해 자세히 설명합니다.
- SWE-bench Verified는 Python 저장소에서 GitHub 이슈를 해결하는 모델의 능력을 테스트하는 검토된 500개의 소프트웨어 엔지니어링 작업 하위 집합입니다.
- 에이전트 설계 철학은 최소한의 지원 구조로 언어 모델에게 제어를 우선적으로 부여하며, Bash 및 Edit 도구를 사용합니다.
- 디렉토리 이동 시 오류를 피하기 위해 절대 경로를 요구하는 등 오해를 방지하기 위해 도구 설명이 정제되었습니다.
- 시스템은 모델이 완료했다고 판단하거나 200k 컨텍스트 길이를 초과할 때까지 샘플링합니다.
이 게시물은 개발자가 코딩 작업에서 Claude 3.5 Sonnet의 가능한 최고의 성능을 얻기 위해 에이전트 아키텍처를 이해하는 데 도움을 주는 것을 목표로 합니다.