对OpenAI的o3和o4-mini模型在“人类最后的考试”上的评估显示,它们的校准误差显著低于前代产品,尽管o3的表现并不优于随机基线的统计显著性。分析表明,与倾向于在所有任务中预测高信心的o1等前代模型相比,o3表现出广泛的信心不足。
- 在“人类最后的考试”中,o3的信心分布近乎均匀,导致其校准误差低于其他表现劣于随机基线的模型。
- 校准曲线显示,o3的准确率与信心之间没有强烈的视觉相关性,表明其在困难任务上的较低平均信心推动了该指标,而非精确的自我意识。
- 在饱和的GSM8k数据集上,o3仍然广泛表现出信心不足,而o4-mini的校准更好;然而,修改提示以要求为信心分数提供推理过程,可将o3的校准误差从24%降低至9%。
研究结果表明,虽然较新的OpenAI模型比前代产品具有更好的校准能力,但它们在与一致地激发信心方面存在困难,尤其是在它们仍然信心不足的简单任务上。