OpenAI推出了GPT-6 Sol和Luna,作为GPT-6 Astra更快、更实惠的替代品,将编码、事实准确性、计算机使用和职业任务方面的进步带入低成本模型。
- Anthropic发布了Claude Opus 5.5,在大多数工作上与Claude Fable 5.1相当,但运行成本比Opus 5低40%。
- SWE-Bench Pro V2发布,包含来自11个存储库的642个任务,修正了之前的任务错误并优化了评估流程。
- Google推出了RRSI,这是一种使AI代理能够递归改进自身的方法,以减少基准测试过拟合。
这些更新为用户提供了更具成本效益的模型选项和严格的新基准,用于评估AI性能。