← 返回 lab NVIDIA Technical Blog · 1 小时前 · inference NVIDIA AVO在ARC-AGI-3基准测试中达到100% 译自 English → 中文 NVIDIA发布了其AVO架构,该架构在ARC-AGI-3基准测试中取得了完美分数。该系统旨在通过管理上下文、工具使用和状态恢复来支持长周期自主智能体。 NVIDIA AVO作为面向扩展任务的通用架构,展现出前沿级性能。该框架解决了智能体工具包如何决定模型与工具的交互及反馈循环的问题。该架构旨在使前沿语言模型在长时间运行的操作中可靠工作。 重要性 2/3 具有差异化优势的新评测框架 NVIDIA Technical Blog NVIDIA AI agents Benchmark results 阅读原文 相关文章 media r/LocalLLaMA · 2 小时前 · 1 次浏览 NVIDIA AVO在ARC-AGI-3上取得100%成绩 NVIDIA的AVO模型在ARC-AGI-3基准测试中取得了完美分数。它在没有任何指令、明确规则或既定目标的情况下,成功完成了25个公共环境中的所有183个关卡。 media r/LocalLLaMA · 4 天前 · 11 次浏览 Qwen3.8 27B在Artificial Analysis智能体指数上超越Opus 5 Medium Qwen团队发布了Qwen3.8 27B模型,该模型在Artificial Analysis智能体指数上超越了Opus 5 Medium。 lab NVIDIA Research · 9 天前 · 35 次浏览 NVIDIA发布OmniDreams实时生成式世界模型,用于自动驾驶仿真 NVIDIA推出了OmniDreams,这是一种基础生成式世界模型,旨在解决闭环仿真中评估自动驾驶策略时的瓶颈。该模型基于Cosmos扩散模型,在21k小时的驾驶场景上进行中期和后期训练,能够以自回归方式实时生成动作条件视频。 media MarkTechPost · 9 天前 · 33 次浏览 NVIDIA发布Nemotron 3.5 Lightning模型和NeMo Switchyard路由器 NVIDIA发布了两个旨在构建全天候AI智能体的开源组件:Nemotron 3.5 Lightning模型和NeMo Switchyard路由库。这些工具通过提供专门的执行和路由能力,解决了将长运行智能体工作流的每一步都发送到前沿推理模型所带来的高昂成本和延迟问题。 arxiv arXiv cs.AI · 11 天前 · 29 次浏览 Ouroboros 自开发智能体使用 Opus 5 创下新基准记录 Ouroboros 是一个自开发智能体框架,其中的工具、提示词和核心实现通过经过审查的提交进行改进,这些提交成为后续工作的运行时环境。它通过递归自由进化或由经验驱动的核心进化运行,后者由使用过程中发现的错误和低效问题触发。
media r/LocalLLaMA · 2 小时前 · 1 次浏览 NVIDIA AVO在ARC-AGI-3上取得100%成绩 NVIDIA的AVO模型在ARC-AGI-3基准测试中取得了完美分数。它在没有任何指令、明确规则或既定目标的情况下,成功完成了25个公共环境中的所有183个关卡。
media r/LocalLLaMA · 4 天前 · 11 次浏览 Qwen3.8 27B在Artificial Analysis智能体指数上超越Opus 5 Medium Qwen团队发布了Qwen3.8 27B模型,该模型在Artificial Analysis智能体指数上超越了Opus 5 Medium。
lab NVIDIA Research · 9 天前 · 35 次浏览 NVIDIA发布OmniDreams实时生成式世界模型,用于自动驾驶仿真 NVIDIA推出了OmniDreams,这是一种基础生成式世界模型,旨在解决闭环仿真中评估自动驾驶策略时的瓶颈。该模型基于Cosmos扩散模型,在21k小时的驾驶场景上进行中期和后期训练,能够以自回归方式实时生成动作条件视频。
media MarkTechPost · 9 天前 · 33 次浏览 NVIDIA发布Nemotron 3.5 Lightning模型和NeMo Switchyard路由器 NVIDIA发布了两个旨在构建全天候AI智能体的开源组件:Nemotron 3.5 Lightning模型和NeMo Switchyard路由库。这些工具通过提供专门的执行和路由能力,解决了将长运行智能体工作流的每一步都发送到前沿推理模型所带来的高昂成本和延迟问题。
arxiv arXiv cs.AI · 11 天前 · 29 次浏览 Ouroboros 自开发智能体使用 Opus 5 创下新基准记录 Ouroboros 是一个自开发智能体框架,其中的工具、提示词和核心实现通过经过审查的提交进行改进,这些提交成为后续工作的运行时环境。它通过递归自由进化或由经验驱动的核心进化运行,后者由使用过程中发现的错误和低效问题触发。