NVIDIA Nemotron-3模型在IOI 2026中取得金牌和人类最高分
研究人员为大型语言模型开发了一套后训练流水线,使其能够在竞技编程中达到金牌水平。通过结合监督微调、强化学习以及一种名为GenCorrect的新型反馈驱动策略,该系统在IOI 2026问题集上超越了顶级人类选手。
研究人员为大型语言模型开发了一套后训练流水线,使其能够在竞技编程中达到金牌水平。通过结合监督微调、强化学习以及一种名为GenCorrect的新型反馈驱动策略,该系统在IOI 2026问题集上超越了顶级人类选手。
研究人员推出了GRASP,这是一种策略感知、多阶段的规划框架,旨在通过将流水线解耦为专用模块,为复杂任务生成高质量的自然语言可执行计划。该系统通过GenPlan预编译全局宏观指南,通过RevPlan探索局部策略,并使用称为VerPlan的多标准判别器评估轨迹。
研究人员提出了 AIDE^2,该系统通过优化自身代码,为前沿 AI 研究代理实现了递归自我改进的循环。该系统对其内部逻辑提出更改,在 AI 研发任务上对修改后的版本进行基准测试,并仅保留在隐藏评估中表现最佳的更新。
研究人员推出了 CliffCompaction,这是一种专为处理数百万 token 的智能体设计的自动压缩技术,可在有界上下文下将成本降低高达 50%。该方法通过在截断而非改写时保持信息忠实度,在 Terminal-Bench 上维持或提升了性能,并在 KernelBench 上取得了最先进结果。
作者介绍了 Fathom-Vaidya,这是一个拥有 30B 参数的模型,它使用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理。训练框架首先对来自 MedBullets 的诊断问题应用规则引导的 RL,然后利用具有多维量表的 5.3k 合成多轮场景进行交互式临床任务。
OpenAI 发布了 Open-1B,这是一种语言模型,其训练过程中的每一步操作都可以在异构商用硬件上以比特级精度独立复现。这种方法通过为 GPU 内核归约和数据批次排序等不确定性来源施加明确的顺序,解决了开源模型固有的可复现性问题。
作者介绍了Stellar Colosseum,这是一个模型无关的框架,旨在为数学和理论计算机科学领域的长周期研究分配推理资源。该系统在构建证明之前探索替代策略,使用就绪门控(readiness gate)判断某条路径是否足够成熟以进行分解,并将证明计划表示为相互依赖的章节级子问题。
Vidu S2 包含 Vidu S2-Avatar(实时交互数字角色模型)和 Vidu S2-Editing(实时视频编辑模型)。该系统还探索了为这两个组件实现实时空间视频生成的可行性。
研究人员展示了 TontaubeV1,这是一种文本转语音模型,在保持自然韵律的同时,支持从单张消费级 GPU 进行流式推理。该系统使用 12.5 Hz 的层级 DualCodec 表示法,将语义流与声学细化分离,从而实现低延迟生成。
作者提出了推测不确定性(SU),这是一种通过分析黑盒LLM代理的输出令牌即可恢复预测失败信号的技术,无需访问logits、权重或激活值。通过反转推测解码,一个小型开源权重的草稿模型在一次前向传递中对代理的轨迹进行评分,以提取感知阶段特征并将其与可验证目标进行校准。
FlashAttention-4 通过为非因果推理和因果训练引入新路径,解决了 Blackwell 的 4 位浮点(FP4)张量核心的性能限制。该方法称为 Direct-P,将分数直接映射到 FP4 概率,以绕过通常在矩阵乘积缩小后占主导地位的 softmax 转换开销。
该论文介绍了 CANOPY(Coverage-ANchored On-PolicY RL),这是一种解决小型开放模型长周期强化学习中信号匮乏和策略漂移问题的协议。通过扩展同任务探索并保持更新以 KL 为锚点,该方法使智能体能够仅从任务结束时的验证中有效学习。