在2024年ARC Prize竞赛结束时,两项新的已验证提交在ARC-AGI公共排行榜(ARC-AGI-Pub)上取得了最先进的分数。杰里米·伯曼使用Claude Sonnet 3.5的进化式测试时计算方法获得了53.6%的成绩,而MIT和康奈尔大学的联合团队通过测试时训练达到了47.5%的准确率。
杰里米·伯曼的方法迭代生成并优化Python转换函数以避免局部最大值,每个任务最多可生成500个函数。MIT/康奈尔的合作利用了互补的归纳和传导技术,在8B参数语言模型上使准确率比基础微调模型提高了6倍。
这些结果展示了在使用放宽的计算约束下,针对ARC-AGI基准测试前沿模型方面取得的实质性进展。