来自Meta的FAIR、牛津大学以及伦敦大学学院的研究团队引入了AI研究偏好模型(RPMs),以帮助AI代理对未执行的机器学习实验候选项进行排序。该方法解决了创意生成成本低廉但通过GPU训练进行验证成本高昂的瓶颈问题。

  • RPMs使用冻结的预训练LLM,无需微调,利用开源AIRA-dojo框架和Qwen3.6-27B作为骨干模型。
  • 该系统生成15个并行候选项,并通过基于验证分数的两两淘汰赛选出优胜者。
  • 测试了两种变体:纯推理裁判和在被隔离环境中运行简短试点实验的智能代理裁判。
  • 在AIRS-Bench上,RPMs将平均归一化分数从0.684提升至0.711(纯推理)和0.729(智能代理)。
  • 两种变体均在约15小时内达到基线的最终得分,相比随机选择实现了1.5–1.6倍的加速。

作者认为这很重要,因为它允许代理将计算资源集中在最有希望的实验上,从而显著加速研究进展,而无需更强的基础模型。