研究人员推出了BenchMIRT,这是一种利用多维项目反应理论(Item Response Theory)在单个提示级别上审计大型语言模型基准的方法。通过分析100个模型和34,000道题目的表现,该工具解耦了通常掩盖基准分数的混合能力,如安全性和通用推理。

  • BenchMIRT在未进行预先标注的情况下,独立恢复了安全和通用推理作为主导维度。
  • 它揭示出BBQ和WMDP等基准与通用推理的相关性比其预期的安全重点所暗示的更强。
  • 该方法识别出最具信息量的题目,表明仅保留10%的题目即可保持几乎相同的评估能力。
  • BenchMIRT对未见题目的正确性预测准确率达到79%,优于更简单的基线方法。

这种方法帮助研究人员理解基准实际测量的是什么,并通过移除信息量较少的题目来设计更高效、更集中的评估。