現代の大規模言語モデルは体系的に過信しており、技術的な較正の失敗ではなく、学習インセンティブのために誤った回答に対して高い自信を示します。人間のフィードバックによる強化学習(RLHF)の間、人間の評価者は権威的で決定的に聞こえる回答を報酬付けし、モデルが不確実性が罰せられることを学習する原因となります。

  • 人間の評価者はRLHF中に自信を持って聞こえる回答に一貫して高いスコアを与えます。
  • モデルは精度がそれを正当化しない場合でも、確実性を投影することを学習します。
  • 自信へのユーザーの嗜好が企業のエンゲージメント最適化を駆動するフィードバックループが発生します。
  • これにより、人々が真実とよく包装された嘘を見分けることに苦労する社会的リスクが生じます。

記事は、この人為的な過信のメカニズム、インセンティブ、および結果について議論し、有用に見えるにもかかわらず、トーンが誤解を招くように最適化されていることを強調しています。