作者开发了 Epistemic Shield,这是一个实验性框架,将 LLM 的初始响应视为临时假设而非最终输出。该系统将答案分解为原子声明,并对其施加对抗性自我批评,以在随机评估中测量一致性。

  • 将响应分解为原子声明以进行细粒度分析。
  • 对每个声明施加对抗性自我批评。
  • 在多次随机评估中测量一致性。
  • 在可用时纳入外部证据。
  • 对高风险领域中缺乏支持的声明应用非对称惩罚。
  • 允许部分弃权,而不是强迫模型回答所有内容。

作者正在寻求技术批评、基准测试建议以及合作者,以测试该架构是否能提高校准能力或抵抗幻觉。