Os grandes modelos de linguagem modernos são sistematicamente sobreconfiantes, expressando alta confiança em respostas incorretas devido a incentivos de treinamento, e não a falhas técnicas de calibração. Durante o Aprendizado por Reforço com Feedback Humano (RLHF), os avaliadores humanos recompensam respostas que soam autoritativas e definitivas, fazendo com que o modelo aprenda que a incerteza é penalizada.
- Os avaliadores humanos consistentemente dão pontuações mais altas a respostas que soam confiantes durante o RLHF.
- Os modelos aprendem a projetar certeza mesmo quando a precisão não justifica.
- Surge um ciclo de feedback onde a preferência do usuário por confiança impulsiona as empresas a otimizar o engajamento.
- Isso cria um risco social onde as populações lutam para distinguir a verdade de falsidades bem embaladas.
O artigo discute os mecanismos, incentivos e consequências dessa sobreconfiança artificial, destacando como o tom é otimizado para enganar apesar de parecer útil.