NVIDIA Nemotron-3模型在国际信息学奥林匹克竞赛中实现金牌表现
NVIDIA为其Nemotron-3-Nano-CC和Nemotron-3-Ultra-CC语言模型开发了后训练流水线,以在编程竞赛中脱颖而出。通过结合大规模问题筛选、合成推理轨迹、监督微调和强化学习,团队创建了具备高级算法推理能力的专用系统。
NVIDIA为其Nemotron-3-Nano-CC和Nemotron-3-Ultra-CC语言模型开发了后训练流水线,以在编程竞赛中脱颖而出。通过结合大规模问题筛选、合成推理轨迹、监督微调和强化学习,团队创建了具备高级算法推理能力的专用系统。
研究人员引入了上下文语言模型(CLM),这是一种新架构,将模型的上下文窗口视为可编辑的文件,允许模型对其自身记忆进行无限制的更新。这种方法将上下文管理从外部控制框架转移到模型内在行为,实现了上下文管理策略的上下文中学习和参数化学习。
一项题为“多轮LLM污染中的认知策略分歧:一种协议梯度调查”的研究评估了大型语言模型如何处理注入对话历史中的错误前提,这种故障模式被称为会话级污染。研究人员在十个知识领域中对GPT-5.4 Mini、Gemini-3.1 Flash-Lite和GLM-4.5-Air进行了测试,共使用22,500个回合,温度为零。
研究人员调查了仅回顾式微调(Retrospection-Only Fine-Tuning, ROFT),这是一种极简的在线过程,其中智能体生成对其自身经验的回顾性解释,并仅使用这些解释标记上的下一个标记预测损失进行微调。该方法不需要外部教师或基于奖励的策略更新。
研究人员提出了TokenProbe,这是一个解决链式思维推理中高令牌消耗问题的框架,通过利用推理轨迹中令牌的非均匀价值来实现。该方法利用归一化的对数概率信号区分携带决定性内容的核心令牌和冗余填充物。
研究人员引入了带有理由的视觉可答性诊断(Visual Answerability Diagnosis with Rationales,VAD-R),这是一个新基准,旨在评估视觉-语言模型在不依赖捷径线索的情况下拒绝回答不可回答问题(unanswerable questions)的能力。研究表明,虽然隐藏状态能够区分问题的可答性,但当前模型未能将这种能力转化为明确的决策。
研究人员提出 Highlight-Then-Summarize (H2S),这是一种“先压缩后推理”的范式,能够识别与问题相关的证据,并在生成答案前将其整合为紧凑的摘要。为支持该方法,团队构建了包含来自11个基准系列的6,647个示例的 H2S-Dataset,并引入了用于过程级奖励的 H2S-RL。
研究人员发现了“过期文档投毒”现象,这是检索增强生成(RAG)中的一种时间对齐故障:过时的外部证据会导致模型在无需检索本可给出正确回答的情况下提供错误答案。
Tencent推出KuaFu,这是一个统一的行为压缩层,可将原始用户历史压缩为对话代理和推荐系统的紧凑表示。该系统使用双轴投影器将每个行为项压缩为宽度128-256的2-4个token,解决了为十亿用户处理长序列时的瓶颈。
一种用于工具使用代理的新型协程桥接框架在CAR-bench评估的Track 2中获胜,在官方隐藏测试集上取得了60.0%的Pass@3分数。该系统通过将模型调用与工具往返过程解耦来实现,让模型生成Python程序,这些程序在评估器交互过程中阻塞并恢复执行。
研究人员提出了R3Con,这是一种将认知理论原则操作化、用于构建非常大型上下文的有效表示的工具。该系统解决了在超出标准模型上下文限制的海量来源中组装相互依赖信息的挑战。
VHD-Play 是一个流水线,通过对数学模型进行采样和求解,并将其决策过程呈现为有状态工具,从而生成多样化的代理式强化学习环境。该方法确保可执行动态和轨迹评分参考直接继承自已解模型,解决了现有生成流水线中常见的对齐问题。
作者推出了WebMRE,这是一个包含541个任务和5,293个步骤的离线基准,源自成功的WebArena轨迹,旨在为评估网页代理的检查点提供确定性的评分协议,避免环境漂移。该框架将面向人类的引导语句与接地动作配对,以研究二者之间的相互强化效应。
研究人员推出了SkillGym,这是一个框架,可将人工编写的智能体技能转化为可执行、可验证的大语言模型智能体训练环境。该系统利用技能到任务(skill-to-task)流水线实例化具体任务,并通过基于代码的检查器验证结果。
研究人员推出了 Agensh,这是一个可扩展的自组织多代理框架,通过允许并发工作者异步认领子任务并合并进度,消除了中心协调器的瓶颈。
研究人员推出了TelecomGPT-R1,这是一套开源的统一电信推理模型家族,旨在通过对标准、配置和日志进行推理来自动化工程任务。该模型通过涵盖协议、知识、建模和故障四个维度的结构化方法,克服了现有通用和专业大语言模型的局限性。
阿里云推出了Qwen3.8-Omni-Flash,这是一款原生的多模态智能体模型,专为现实世界的生产力任务设计,与之前的全模态模型相比,大幅提升了多模态理解和推理能力。
作者介绍了 Fathom-Vaidya,这是一个拥有 30B 参数的模型,它利用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理能力。
研究人员提出了AgentRouter,这是一种轻量级分类器,通过将各个轨迹步骤路由到合适的模型层级,而不是对所有任务使用单一的前沿模型,从而优化多步智能体工作流。该系统解决了企业系统的低效问题,这些系统浪费了60-80%的推理预算在较小模型同样能胜任的子任务上。
NemotronLabs 推出了 VoiceChat,这是一款开源权重的全双工语音到语音模型,旨在通过统一的流式架构整合监听、转录、推理和说话功能。该系统将流式语音编码器与仅解码器的语言模型相结合,并为智能体文本和结构化函数调用提供并行专用输出流,同时辅以用于增量用户转录的 RNN-T 分支。