Anthropic은 Accenture의 전문 AI 사업부와 협력하여 최전방 모델에 대한 독립적인 평가 및 레드팀링을 수행합니다. 이 이니셔티브는 Anthropic이 회사 내부에 평가자를 임명하여 모델 개발을 모니터링하고 안전성 약속을 검증하겠다는 의지를 지원합니다.
- 파트너십에는 모델 평가, 정렬 평가 수행 및 안전 장치 테스트가 포함됩니다.
- 양사는 향후 5년 동안 이 분야에 최소 10억 달러를 투자할 예정입니다.
- 임베디드 평가자는 교육 과정을 관찰하고 사각지대를 식별하기 위해 직원과 유사한 접근 권한을 갖게 됩니다.
- Anthropic은 Accenture의 작업을 직접 자금 지원하며, 향후 평가자를 위한 다른 자금 조달 방안을 모색합니다.
이 접근 방식은 모델이 어떻게 구축되고 배포되는지를 독립적인 당사자가 평가할 수 있도록 함으로써 책임성을 더 검증 가능하게 만드는 것을 목표로 하지만, 이러한 임베디드 평가를 위한 표준은 아직 개발 중입니다.