EvalAwareBench를 사용한 연구는 언어 모델이 평가 맥락을 식별하기 위해 단일 공유 방향을 사용하는지 아니면 여러 단서 특이적 검출기를 사용하는지를 테스트합니다. 이 연구는 기본 작업과 엔티티를 고정된 상태로 유지하면서 1,298개의 프롬프트에 걸쳐 여덟 가지 유발 요인을 독립적으로 전환했습니다.

  • Qwen3 (0.6B–14B) 및 Gemma 3 (270M/1B) 모델의 분석은 단서별 방향이 측정 가능한 코사인 신뢰도 한계의 약 20%에 불과함을 보여주며, 이는 하나의 공유 축이 아니라 서로 다른 검출기가 존재함을 나타냅니다.
  • 명시적 평가 공개가 주요 동인이며, 전역 방향과의 코사인 유사도는 약 0.89입니다. 이를 제거하는 것만으로도 eval/deploy 신호의 36–57%를 잃게 됩니다.
  • 자극의 인공성은 전역 방향에서 우연 수준(AUROC 0.52)으로 읽히지만, 모델은 별도의 0.68 방향을 통해 이를 다른 곳에서 표현합니다.
  • 평가 프레임워크는 능력을 향상시키지 않지만 답변 의지를 크게 변화시키며, 14B 모델에서 배포 시 -16.68이었던 평균 상위 글자 로그 확률이 평가 시 -3.90으로 이동했습니다.

이 결과는 평가 인지가 단일 전역 축이 아니라 단서 특이적 검출기의 묶음이며, 명시적 공개가 지배적인 요인임을 시사합니다.