현대 대규모 언어 모델은 체계적으로 과신하며, 기술적 교정 실패가 아닌 학습 인센티브로 인해 잘못된 답변에 대해 높은 확신을 표현합니다. 인간의 피드백을 통한 강화 학습(RLHF) 동안 인간 평가자는 권위 있고 결정적으로 들리는 답변을 보상하여 모델이 불확실성이 처벌받는 것을 학습하게 만듭니다.

  • 인간 평가자는 RLHF 동안 자신감 있게 들리는 답변에 일관되게 더 높은 점수를 부여합니다.
  • 모델은 정확도가 이를 정당화하지 않더라도 확신을 투영하는 방법을 학습합니다.
  • 사용자의 확신 선호도가 기업의 참여 최적화를 주도하는 피드백 루프가 발생합니다.
  • 이는 인구가 진리와 잘 포장된 거짓말을 구분하는 데 어려움을 겪는 사회적 위험을 만듭니다.

이 기사는 이러한 인공적 과신의 메커니즘, 인센티브 및 결과를 논의하며, 도움이 되는 것처럼 보임에도 불구하고 어조가 오도하도록 최적화되는 방법을 강조합니다.