Symphony 通过分层异构处理编排稀疏和稠密张量
本文提出了 Symphony,这是一种混合可编程和专用架构,旨在解决当前高性能架构(如 GPU)中内存系统效率低下的问题。它专注于在整个内存层次结构中编排数据,以减少不必要的数据移动和距离。
本文提出了 Symphony,这是一种混合可编程和专用架构,旨在解决当前高性能架构(如 GPU)中内存系统效率低下的问题。它专注于在整个内存层次结构中编排数据,以减少不必要的数据移动和距离。
研究人员通过将任务重新定义为时间条件的潜在域转换,解决了长时视频重光照中的时间不连续性问题。该框架通过跨边界传播目标域潜在变量来强制分块间的连续性,并利用掩码目标域自条件使这种行为可学习。
来自 Nvidia 的研究人员推出了 FusionRelight,这是一种用于人像重光照的方法,它将物理上合理的照明转移与身份保持以及紧凑的实时推理相结合。该方法利用混合领域知识融合(HDKF)训练框架,将合成数据、一次一盏光(OLAT)数据和真实场景数据中的物理、反射率和真实性先验蒸馏到一个学生模型中。
一篇新论文探讨了使用基础大型语言模型(LLM)来自动化超参数优化(HPO),这一过程通常在有限预算设置下依赖手动方法。作者开发了一种方法论,其中LLM根据数据集和模型的描述建议超参数配置,然后根据模型性能进行迭代优化。
研究人员推出了Source,这是一种新的训练数据归因(TDA)方法,结合了影响函数的计算效率和基于展开方法的准确性。通过使用类似影响函数的公式来近似展开微分,Source解决了隐式微分方法的局限性,例如它们未能考虑优化偏差或多阶段流水线。
NVIDIA推出了OmniDreams,这是一种基础生成式世界模型,旨在解决闭环仿真中评估自动驾驶策略时的瓶颈。该模型基于Cosmos扩散模型,在21k小时的驾驶场景上进行中期和后期训练,能够以自回归方式实时生成动作条件视频。
该论文介绍了JacNet,这是一种神经网络架构,它直接学习输入-输出函数的雅可比矩阵,而不是映射本身。这种方法允许对导数属性进行精确控制,从而能够实施结构性先验,如可逆性和k-Lipschitz连续性。
本文介绍了一篇由 jlorraine 撰写的论文,该论文解决了将双层或嵌套优化应用于大规模深度学习设置时面临的挑战。虽然基于梯度的优化通常更新一组参数,但许多应用需要在彼此嵌套的不同目标上更新参数的子集。
研究人员提出了Masters,一种用于将大规模视觉-语言模型蒸馏为适合边缘部署的紧凑版本的掩码渐进式强化学习框架。该方法解决了因师生模型尺寸差距导致的不稳定性问题。
研究人员在解码过程中发现相关视觉信息偏移(RVIS)是导致现有视觉令牌剪枝方法在多模态大语言模型(MLLM)中失效的主要原因。为解决这一问题,他们提出了无需训练的解码阶段感知偏移令牌剪枝(DSTP),将视觉令牌与变化的推理需求对齐。
研究人员提出了 GenRecal,这是一种通用的蒸馏框架,可将知识从大型视觉-语言模型(VLM)转移到更小、更高效的对应模型。该方法通过使用重新校准器来对齐和适应不同模型类型之间的特征表示,解决了 VLM 架构异构性的挑战。
研究人员引入了近端策略优化的最近发展区(ZPPO),该方法将教师知识注入提示中,而非策略梯度,以解决知识蒸馏中的脆弱性和强化学习中的漂移问题。ZPPO 为难题构建包含正确候选项的问题(BCQ)和包含错误候选项的问题(NCQ),并通过重放缓冲区循环使用这些样本,直到学生模型的准确率提升或将其淘汰。
研究人员提出了一种新颖的思考-回答蒸馏框架,通过掩码显著推理前缀,提高了紧凑视觉语言模型利用视觉证据的能力。这种方法解决了长思考-回答轨迹中常见的“视觉遗忘”问题,学生在扩展推理过程中会失去对视觉线索的关注。
研究人员提出了 SpatialClaw,这是一个无需训练的框架,采用代码作为动作接口,以改进视觉-语言模型中的开放式 3D 和 4D 空间推理。与依赖单次执行或僵化工具调用的现有智能体不同,SpatialClaw 维护一个有状态的 Python 内核,其中预加载了输入帧和感知基元。
研究人员提出代理探索策略优化(AXPO),以解决视觉语言模型在需要外部工具时存在的“思考-行动差距”。这一差距导致GRPO等标准强化学习方法仅在约30%的 rollout 中尝试使用工具,且高失败率抑制了学习信号。
研究人员提出了ROSA,这是一种面向机器人工厂的机器人基础模型推理系统,突破了单机器人、边缘计算的假设。该系统利用共享GPU池服务,使机器人群体能够通过网络访问服务器级GPU。
NVIDIA的研究人员推出了Spatial-IQ,这是一种旨在解构多模态大语言模型(MLLMs)空间智能的诊断框架。与将模型视为黑盒的现有基准不同,该方法将堆叠3D结构中的物体计数分解为九个与人类发展阶段相一致的感知和认知子任务。
研究人员提出了Cluster-Guided Vector Quantization (CGVQ),这是一种旨在提高基于高斯基元图像压缩率失真性能的方法。该方法在量化之前将高斯参数划分为同质组,解决了为每个基元存储大量浮点参数导致的低效问题。
研究人员分析了竞技射击游戏 Delta Force 的游戏视频,以提取和理解新兴的非语言交流,如手势和移动模式。这项工作解决了先前研究的空白,这些研究主要集中于 MOBA 游戏或其他射击游戏中的语音协调。
英伟达的研究人员通过采用实地实验方法论,来解决安排竞争性团体比赛和重现实验室环境的难题。这种方法将实验直接整合到锦标赛结构中,创造出混合型的锦标赛-实验。