NVIDIA的AVO模型在ARC-AGI-3基准测试中取得了完美分数。它在没有任何指令、明确规则或既定目标的情况下,成功完成了25个公共环境中的所有183个关卡。
- NVIDIA AVO在ARC-AGI-3上得分100%。
- 该模型在25个公共环境中解决了所有183个关卡。
- 它在没有指令、明确规则或既定目标的情况下运行。
NVIDIA的AVO模型在ARC-AGI-3基准测试中取得了完美分数。它在没有任何指令、明确规则或既定目标的情况下,成功完成了25个公共环境中的所有183个关卡。
NVIDIA Nemotron Model Reasoning Challenge 邀请 Kaggle 社区在共享约束(开放模型、基准测试和基础设施)下探索提高推理准确性的技术。比赛结束时,来自 4000 个团队的 5000 多名活跃参与者提交了数千份作品。
NVIDIA研究员Ivan Sorokin和Jean-Francois Puget赢得了Kaggle ARC Prize 2025,在ARC-AGI-2基准测试中以27.64%的得分位列公共排行榜第一。他们的解决方案名为NVARC,使用了经过微调的4B模型变体,仅以每项任务20美分的成本就超越了更大的模型。
NVIDIA发布了其AVO架构,该架构在ARC-AGI-3基准测试中取得了完美分数。该系统旨在通过管理上下文、工具使用和状态恢复来支持长周期自主智能体。
OpenAI 于 2026 年 5 月 28 日宣布,o3 模型将于 2026 年 8 月 26 日在 ChatGPT 中退役,此前经历了 90 天的过渡期。虽然 API 将无限期保持可用,但建议用户迁移到 o4 或 GPT-5 系列等后继产品,以处理复杂的推理和编码任务。
OpenAI 的 GPT-5.2 Pro 在 FrontierMath Tier 4 基准测试中取得了 31% 的新纪录分数,解决了 48 个问题中的 15 个。这比之前的最高分 19% 有了显著改善,并且没有显示出针对 OpenAI 独家访问的 28 个测试问题出现过拟合(over-fitting)的迹象。