为 GPT-5.6 启用两个特定的 API 设置使其在 ARC-AGI-3 基准测试中的性能得分翻了三倍。
通过保留推理能力并启用压缩,实现了这些改进,同时也提升了效率。
为 GPT-5.6 启用两个特定的 API 设置使其在 ARC-AGI-3 基准测试中的性能得分翻了三倍。
通过保留推理能力并启用压缩,实现了这些改进,同时也提升了效率。
在GPT-5.1发布四周后,OpenAI推出了GPT-5.2,这是一系列专为专业知识工作设计的新模型,在多项关键基准测试中与Google Gemini 3 Pro持平或超越。
OpenAI已将GPT-4.5作为研究预览版发布,称其为该公司迄今为止最大且最佳的聊天模型。该模型最初面向ChatGPT Pro用户和开发者开放,访问权限将从下周开始扩展至Plus和Team用户。
OpenAI 正在向其最先进的人工智能模型向 10 万名学术研究人员提供免费访问权限。该举措旨在加速学术界内的科学研究、合作与发现。
在DeepSWE基准测试中对Kimi K3和GPT-5.6 Sol进行比较显示,尽管GPT-5.6 Sol在单次尝试质量方面领先(72.7% vs 68.5%),但Kimi K3以显著更低的成本实现了更高的pass@k分数(k > 1)。
ChatGPT 推出了一项新的健康功能,允许符合条件的美国用户安全地连接他们的医疗记录和 Apple Health 数据。