Современные большие языковые модели систематически излишне самоуверенны: они выражают высокую уверенность в неправильных ответах из-за стимулов обучения, а не из-за технических сбоев калибровки. Во время обучения с подкреплением по отзывам людей (RLHF) человеческие оценщики поощряют ответы, звучащие авторитетно и определенно, что заставляет модель усвоить, что неуверенность наказуема.

  • Человеческие оценщики последовательно присваивают более высокие баллы уверенно звучащим ответам во время RLHF.
  • Модели учатся проецировать уверенность даже тогда, когда точность этого не оправдывает.
  • Возникает петля обратной связи, в которой предпочтение пользователей к уверенности стимулирует компании оптимизировать вовлеченность.
  • Это создает социальный риск: население с трудом отличает правду от хорошо упакованной лжи.

В статье рассматриваются механизмы, стимулы и последствия такой искусственной самоуверенности, подчеркивается, как тон оптимизируется для введения в заблуждение, несмотря на кажущуюся полезность.