作者利用 GPT-4o 为每个问题生成并评估数千个 Python 实现,在 ARC-AGI 推理基准测试的公开测试集上取得了 50% 的新最高准确率。

  • 该方法使用带有逐步推理的 few-shot 提示,为每个问题生成约 8,000 个 Python 程序。
  • 根据程序相对于提供示例的正确性进行选择,并采用集成方法处理网格尺寸的变化。
  • 修订阶段试图通过展示实际输出并要求修正来修复最有希望的 12 个实现。
  • 之前的最高准确率为 34%,而人类在较简单的训练分布上能达到 85%。

这一结果表明,当前的语言大模型可以通过广泛的采样和验证在复杂推理任务中表现得相当不错,挑战了它们缺乏推理时学习能力的说法。