Grand Coder 的创作者报告了旨在帮助能力较强的 AI 模型进行推理并更勤奋工作的内部历史评估,而非让模型本身变得更聪明。一项分层工程研究最初运行了 96 次独立执行,但因无效隐藏要求排除了两个任务族,留下 72 次运行用于分析。

  • 基线通过了 18 个任务中的 13 个,而三个 Grand Coder 配置分别通过了 16/18、16/18 和 15/18。
  • 收益集中在两个保留的任务族中,其他四个在所有条件下均已通过。
  • 其他评估显示测试已饱和,无差异或看似获胜的结果在评分校正后消失。
  • 盲审评分在一个构建研究中有所提高,但校正后的行为测试表明以更高成本并无优势。

作者得出结论,Grand Coder 产生了可用于持续工作的具体可衡量收益,强调需将评审者的印象与实际行为检查和成本区分开来。实现细节仍为私有,限制了对这些发现的独立验证。