Grand Coder의 제작자는 AI 모델이 더 능숙하게 추론하고 성실하게 작업할 수 있도록 돕기 위한 내부 역사적 평가 결과를 보고했으며, 이는 모델 자체를 더 똑똑하게 만드는 것이 아닙니다. 단계별 엔지니어링 연구는 처음에 96개의 격리된 실행을 수행했지만, 유효하지 않은 숨겨진 요구 사항으로 인해 두 가지 작업 계열을 제외하고 분석을 위해 72개의 실행만 남겼습니다.
- 기준선은 18개 작업 중 13개를 통과했으며, 세 가지 Grand Coder 구성은 각각 16/18, 16/18, 15/18를 통과했습니다.
- 향상된 부분은 두 개의 유지된 작업 계열에 집중되었으며, 나머지 네 가지는 모든 조건에서 이미 통과했습니다.
- 다른 평가에서는 포화 상태의 테스트가 나타났으며, 점수 보정 후 사라진 겉으로 보이는 승리가 있었습니다.
- 한 빌드 연구에서 블라인드 리뷰 점수가 향상되었지만, 보정된 행동 테스트는 더 높은 비용에도 불구하고 이점이 없음을 보여주었습니다.
저자는 Grand Coder가 지속적인 작업에 유용한 구체적인 측정 가능한 혜택을 생산했으며, 리뷰어의 인상을 실제 행동 확인 및 비용과 분리할 필요성을 강조했습니다. 구현은 비공개로 남아 있어 이러한 발견의 독립적인 검증을 제한하고 있습니다.