Современные большие языковые модели систематически излишне самоуверенны: они выражают высокую уверенность в неправильных ответах из-за стимулов обучения, а не из-за технических сбоев калибровки. Во время обучения с подкреплением по отзывам людей (RLHF) человеческие оценщики поощряют ответы, звучащие авторитетно и определенно, что заставляет модель усвоить, что неуверенность наказуема.
- Человеческие оценщики последовательно присваивают более высокие баллы уверенно звучащим ответам во время RLHF.
- Модели учатся проецировать уверенность даже тогда, когда точность этого не оправдывает.
- Возникает петля обратной связи, в которой предпочтение пользователей к уверенности стимулирует компании оптимизировать вовлеченность.
- Это создает социальный риск: население с трудом отличает правду от хорошо упакованной лжи.
В статье рассматриваются механизмы, стимулы и последствия такой искусственной самоуверенности, подчеркивается, как тон оптимизируется для введения в заблуждение, несмотря на кажущуюся полезность.