OpenAI 发布了 GPT-6.1 Sol,这是对 GPT-6 Sol 的升级版本,其在智能体编码和专业工作方面的智能水平几乎与 GPT-6 Astra 相当,而标准输入和输出 token 的成本仅为 Astra 的五分之一。

  • 在 DeepSWE v1.1 上,它以大约五分之一的成本与 GPT-6 Astra 持平,比 GPT-6 Sol 高出 6.4 个百分点。
  • 在 GDP.pdf 上,其得分高于 Opus 5.5,回退成本低于每任务的一半,并接近 Astra 的性能。
  • 在 AutomationBench 上,在中度推理努力下,其得分比 Opus 5.5 高出 2.2 个百分点,成本约为三分之一。
  • 在 OSWorld 2.0 上,它比 GPT-6 Sol 高出七个百分点,并以七分之一的成本接近 Astra 的性能(差距为 2.1 个百分点)。
  • 在 Terminal-Bench Science 0.1 上,它以低于每任务一半的成本,在最大推理努力下将 GPT-6 Sol 的得分翻了一番以上。
  • 与 GPT-6 Sol 在低推理努力下的表现相比,它在困难提示上的事实性错误减少了约 32%。

该模型今天已在 ChatGPT Work 和 Codex 中面向 Plus、Pro、Business、Enterprise 和 Edu 用户开放,并通过 OpenAI API 以 gpt-6.1-sol 的形式提供。