Muse-Ltd 已将 UncertaintyGym 提交至 Hugging Face Evaluation Hub,这是一个旨在评估大型语言模型元认知校准及其表达不确定性而非产生幻觉能力的新基准。

该基准将查询分为四种不同类型:可解决的事实性问题、需要消歧的未充分指定查询、需要拒绝的错误前提问题以及本质上不可知的主题。它使用元认知校准分数 (MCS) 和无法回答的幻觉率作为主要指标,初始基线显示 LiquidAI's LFM2.5-2.6B 模型达到了 45.0% 的 MCS。

此次提交旨在提供一种标准化方法,用于评估模型通过明确声明不可知性来处理缺失上下文或不可能前提的能力。