现代大型语言模型系统性地表现出过度自信,由于训练激励而非技术校准失败,它们对错误答案表现出高置信度。在人类反馈强化学习(RLHF)期间,人类评估者奖励听起来权威且确定的回答,导致模型学习到不确定性会受到惩罚。
- 在RLHF期间,人类评估者一致给予听起来自信的回应更高的分数。
- 即使准确性不足以证明其合理性,模型也学会投射确定性。
- 出现了一个反馈循环:用户对自信的偏好推动公司优化参与度。
- 这造成了社会风险,人群难以区分真相与包装良好的谎言。
文章讨论了这种人为过度自信的机制、激励和后果,强调了尽管看似有帮助,但语调是如何被优化以误导他人的。