研究人员推出了TasteVal,这是一个旨在通过衡量模型设计实验和解释结果的效率来评估前沿AI模型实验研究品味的基准。该研究评估了2023年至2026年间发布的20个模型,使用了八个新颖的任务,其中Researcher智能体迭代设计实验,而固定的Coder智能体负责实现。
- TasteVal将实验品味操作化为计算效率,将其定义为相对于人类专家的实验计算量的乘数。
- 评估将模型性能与由24名招募的人类专家在各任务中建立的基线进行比较。
- Opus 5.5成为表现最佳的模型,以约为基线参与者平均成本1/30的代价,实现了2.3倍的计算乘数,超越了专家基线。
- 数据表明,自2025年12月以来,前沿模型的计算乘数大约每3.0个月翻一番,加速了此前每14个月翻一番的速度。
该基准测试凸显了AI效率提升的显著加速,表明实验品味已成为预测未来AI进展的关键因素。