OpenAI 发布了 o1-preview 和 o1-mini 模型,这些模型通过生成和细化推理标记来模拟推理过程,然后再提供最终答案。在 ARC-AGI 公开评估数据集上的测试显示,两种 o1 变体在准确性方面均优于 GPT-4o。
- o1-preview 的准确率与 Anthropic 的 Claude 3.5 Sonnet 相当,但完成任务所需时间大约长 10 倍。
- 解决 400 个公开 ARC-AGI 任务,o1 耗时 70 小时,而 GPT-4o 和 Claude 3.5 Sonnet 仅需 30 分钟。
- 这些模型在训练和推理阶段均采用思维链范式,并利用强化学习来优化策略。
- 性能随测试时计算量的增加而提升,准确率与使用的推理标记数量之间呈现对数线性关系。
结果表明,虽然增加测试时计算量可以提高准确性,但效率仍然是实际应用和基准测试中的关键因素。