HorizonRelight 使用掩码自条件实现长时视频重光照的一致性
研究人员通过将任务重新定义为时间条件的潜在域转换,解决了长时视频重光照中的时间不连续性问题。该框架通过跨边界传播目标域潜在变量来强制分块间的连续性,并利用掩码目标域自条件使这种行为可学习。
研究人员通过将任务重新定义为时间条件的潜在域转换,解决了长时视频重光照中的时间不连续性问题。该框架通过跨边界传播目标域潜在变量来强制分块间的连续性,并利用掩码目标域自条件使这种行为可学习。
来自 Nvidia 的研究人员推出了 FusionRelight,这是一种用于人像重光照的方法,它将物理上合理的照明转移与身份保持以及紧凑的实时推理相结合。该方法利用混合领域知识融合(HDKF)训练框架,将合成数据、一次一盏光(OLAT)数据和真实场景数据中的物理、反射率和真实性先验蒸馏到一个学生模型中。
NVIDIA推出了OmniDreams,这是一种基础生成式世界模型,旨在解决闭环仿真中评估自动驾驶策略时的瓶颈。该模型基于Cosmos扩散模型,在21k小时的驾驶场景上进行中期和后期训练,能够以自回归方式实时生成动作条件视频。
NVIDIA的研究人员推出了Spatial-IQ,这是一种旨在解构多模态大语言模型(MLLMs)空间智能的诊断框架。与将模型视为黑盒的现有基准不同,该方法将堆叠3D结构中的物体计数分解为九个与人类发展阶段相一致的感知和认知子任务。
研究人员提出了Cluster-Guided Vector Quantization (CGVQ),这是一种旨在提高基于高斯基元图像压缩率失真性能的方法。该方法在量化之前将高斯参数划分为同质组,解决了为每个基元存储大量浮点参数导致的低效问题。
研究人员分析了竞技射击游戏 Delta Force 的游戏视频,以提取和理解新兴的非语言交流,如手势和移动模式。这项工作解决了先前研究的空白,这些研究主要集中于 MOBA 游戏或其他射击游戏中的语音协调。
英伟达的研究人员通过采用实地实验方法论,来解决安排竞争性团体比赛和重现实验室环境的难题。这种方法将实验直接整合到锦标赛结构中,创造出混合型的锦标赛-实验。
研究人员推出了The AI Telco Engineer (AITE),这是一个利用大语言模型驱动的进化搜索来自主设计复杂通信问题算法的框架,同时平衡性能与复杂度之间的权衡。
NVIDIA推出了CTRL-G(Controllable Generative Graphics for Games),这是一个旨在解决在交互式游戏环境中控制生成式AI系统挑战的框架。
Anthropic推出了Claude Opus 5,这是一款效率更高的模型,其能力接近Claude Fable 5,但价格减半,成为Claude Max的默认模型。与此同时,NVIDIA正在倡导美国政府政策支持开放权重的AI模型,以促进创新并增强美国在该领域的领导地位。
英伟达发布了Cosmos 3 Edge,这是一款拥有40亿参数的开放世界模型,旨在在内存受限的边缘系统上提供数据中心级别的性能。该模型使机器人和视觉AI智能体能够在NVIDIA Jetson模块等设备上直接理解周围环境、实时推理并生成动作。
NVIDIA 发布了 Nemotron 3 Embed,这是一组开源且可商业使用的嵌入模型,旨在提升生产级 RAG、智能体检索、代码检索和智能体记忆的检索质量。该集合包含一个在 RTEB 排行榜上总体排名第一的 8B 模型,以及针对部署优化的高效 1B 变体。
llama.cpp 项目已将其 OpenVINO 后端的重大更新合并,主要启用了针对 Qwen3.5 模型系列的支持,并引入了多项内存优化技术。
阿里巴巴发布了其最大开源模型 Qwen3.8-2.4T-A95B(也称为 Qwen3.8-Max)的开源权重,旨在为开放生态带来接近前沿的能力。
NVIDIA发布了两个旨在构建全天候AI智能体的开源组件:Nemotron 3.5 Lightning模型和NeMo Switchyard路由库。这些工具通过提供专门的执行和路由能力,解决了将长运行智能体工作流的每一步都发送到前沿推理模型所带来的高昂成本和延迟问题。
NVIDIA 已在 Hugging Face 上发布了 Nemotron-3.5-Lightning-30B-A3B 模型。
NVIDIA 已对其 Magpie Multilingual TTS 模型发布更新,通过新增现代标准阿拉伯语、韩语和巴西葡萄牙语,将支持语言扩展至十二种。此次发布还通过更新训练数据和架构变更,提升了现有语言的质量。
Meta发布了Muse Glimmer,这是一个拥有120K+上下文窗口的30B密集参数模型,专为本地AI智能体工作设计。该模型针对NVIDIA边缘、桌面和工作站平台进行了优化,在单张GPU上可实现20K tokens/sec的推理速度。
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款面向实时全双工对话的开源11B参数端到端语音转语音模型。与串联ASR、LLM和TTS的级联堆栈不同,该统一网络同时执行流式语音理解和生成,在Full-Duplex-Bench 1.0上测得的平滑切换延迟为448毫秒。
NVIDIA Labs 已开源 NOOA(NVIDIA Object-Oriented Agents),这是一个与模型无关的 Python 框架,将智能体开发整合到单个 Python 类中。该方法通过将方法映射到动作、字段映射到状态、文档字符串映射到提示词以及类型注解映射到强制契约,取代了涉及提示模板和工作流图的碎片化工作流。