Los modelos de lenguaje grandes modernos son sistemáticamente sobreconfiados, expresando alta confianza en respuestas incorrectas debido a incentivos de entrenamiento en lugar de fallos técnicos de calibración. Durante el Aprendizaje por Refuerzo con Retroalimentación Humana (RLHF), los evaluadores humanos recompensan respuestas que suenan autoritarias y definitivas, haciendo que el modelo aprenda que la incertidumbre es penalizada.

  • Los evaluadores humanos consistentemente otorgan puntajes más altos a respuestas que suenan seguras durante el RLHF.
  • Los modelos aprenden a proyectar certeza incluso cuando la precisión no lo justifica.
  • Surge un ciclo de retroalimentación donde la preferencia del usuario por la confianza impulsa a las empresas a optimizar el compromiso.
  • Esto crea un riesgo social donde las poblaciones luchan por distinguir la verdad de falsidades bien empaquetadas.

El artículo discute los mecanismos, incentivos y consecuencias de esta sobreconfianza artificial, destacando cómo el tono se optimiza para engañar a pesar de parecer útil.