Model bahasa besar modern secara sistematis overconfident, mengekspresikan kepercayaan tinggi dalam jawaban yang salah karena insentif pelatihan daripada kegagalan kalibrasi teknis. Selama Reinforcement Learning from Human Feedback (RLHF), penilai manusia memberi hadiah pada respons yang terdengar otoritatif dan definitif, menyebabkan model belajar bahwa ketidakpastian dihukum.

  • Penilai manusia secara konsisten memberikan skor lebih tinggi pada respons yang terdengar percaya diri selama RLHF.
  • Model belajar untuk memproyeksikan kepastian bahkan ketika akurasi tidak membenarkannya.
  • Sebuah loop umpan balik muncul di mana preferensi pengguna terhadap kepercayaan mendorong perusahaan mengoptimalkan keterlibatan.
  • Ini menciptakan risiko sosial di mana populasi berjuang membedakan kebenaran dari kebohongan yang dikemas dengan baik.

Artikel tersebut membahas mekanisme, insentif, dan konsekuensi dari overconfidence buatan ini, menyoroti bagaimana nada dioptimalkan untuk menyesatkan meskipun tampak membantu.