Anthropic은 Claude Code를 위한 새로운 평가 도구를 출시했으며, 개발자가 평가를 구축하고, 그레이더를 확인하며, 이를 기반으로 애플리케이션을 개선할 수 있도록 설계된 `build_eval` 및 `hill-climb` 명령이 포함된 `claude-api` 플러그인을 도입했습니다.

  • 이 도구는 대화 추적에서 인간 전달, 형식화, 음성 에이전트와 같은 문제를 자동으로 발견합니다.
  • 특정 실패 모드에 대한 평가자를 생성할 수 있지만, 리뷰어는 초기 범위가 너무 넓다고 지적했습니다.
  • 워크플로우에는 그레이더를 확인하고 평가 결과를 기반으로 애플리케이션 성능을 반복적으로 개선하기 위한 명령이 포함됩니다.

리뷰 작성자는 평가자에 확정하기 전에 데이터 탐색을 더 잘 지원할 때까지 도구 사용을 보류할 것을 제안하며, 현재 레이블 검토 인터페이스가 번거롭다고 지적했습니다.