微软发布 Echoverse 用于训练计算机使用代理
微软研究院发布了 Echoverse,这是一组由十二个深度合成环境组成的集合,旨在训练计算机使用代理。该计划包括十个特定领域的世界和两个以能力为中心的世界,所有这些都旨在保持连贯的状态和行为保真度。
微软研究院发布了 Echoverse,这是一组由十二个深度合成环境组成的集合,旨在训练计算机使用代理。该计划包括十个特定领域的世界和两个以能力为中心的世界,所有这些都旨在保持连贯的状态和行为保真度。
一篇新论文探讨了使用基础大型语言模型(LLM)来自动化超参数优化(HPO),这一过程通常在有限预算设置下依赖手动方法。作者开发了一种方法论,其中LLM根据数据集和模型的描述建议超参数配置,然后根据模型性能进行迭代优化。
研究人员推出了Source,这是一种新的训练数据归因(TDA)方法,结合了影响函数的计算效率和基于展开方法的准确性。通过使用类似影响函数的公式来近似展开微分,Source解决了隐式微分方法的局限性,例如它们未能考虑优化偏差或多阶段流水线。
该论文介绍了JacNet,这是一种神经网络架构,它直接学习输入-输出函数的雅可比矩阵,而不是映射本身。这种方法允许对导数属性进行精确控制,从而能够实施结构性先验,如可逆性和k-Lipschitz连续性。
本文介绍了一篇由 jlorraine 撰写的论文,该论文解决了将双层或嵌套优化应用于大规模深度学习设置时面临的挑战。虽然基于梯度的优化通常更新一组参数,但许多应用需要在彼此嵌套的不同目标上更新参数的子集。
研究人员提出了Masters,一种用于将大规模视觉-语言模型蒸馏为适合边缘部署的紧凑版本的掩码渐进式强化学习框架。该方法解决了因师生模型尺寸差距导致的不稳定性问题。
研究人员引入了近端策略优化的最近发展区(ZPPO),该方法将教师知识注入提示中,而非策略梯度,以解决知识蒸馏中的脆弱性和强化学习中的漂移问题。ZPPO 为难题构建包含正确候选项的问题(BCQ)和包含错误候选项的问题(NCQ),并通过重放缓冲区循环使用这些样本,直到学生模型的准确率提升或将其淘汰。
微软研究院推出了EvoLib,这是一个框架,使大型语言模型能够在推理过程中从自身经验中学习,而无需真实标签或外部反馈。EvoLib不将原始经验存储为静态记忆,而是将其转化为可重用的技能和反思性见解,这些技能和见解会不断被精炼、整合和重新加权。
DharmaOCR 通过领域特定训练,在巴西葡萄牙语上的提取质量和稳定性优于 Mistral OCR4 和 Unlimited-OCR。
ThetaMem是一项初步的、单种子研究,针对一种循环混合器,该混合器通过学习到的带符号Hadamard或外积键提升来修改循环状态,而非优化门控机制。作者在合成基准上呈现了混合结果,并明确寻求批评以找出能够证伪该方法的最便宜实验。
Dyna Robotics 发布了 Dyna-2,这是一个用于机器人操作的世界动作模型,在一百多万小时的自我中心人类视频上进行了预训练。该公司通过建立从 1,000 到 1,000,000 小时的扩展定律,证明了普通人类视频可以替代带动作标签的数据。
研究人员开发了 MiLMMT-46-v1.0,这是一种多语言机器翻译模型,将无参考后训练应用于开源大语言模型。该团队使用基于两种无参考质量评估模型的奖励(由语言识别门控)的组相对策略优化 (GRPO)。
研究人员发布了 MiLMMT-46-v1.0,这是一个用于多语言机器翻译的开源大型语言模型,采用了无参考后训练技术。该团队从监督微调的 MiLMMT-46-v0.1 出发,应用了基于两种由语言识别门控的无参考质量评估模型的奖励的组相对策略优化(GRPO)。
Multiverse Computing 提出了一种内存高效的大语言模型知识蒸馏方法,将离线 top-K logits 缓存与融合的分块 Kullback-Leibler (KL) 散度损失相结合。该方法消除了同时保留教师模型和学生模型于内存中的需求,大幅降低了 VRAM 要求。
字节跳动宣布承诺在不依赖AI蒸馏技术的情况下开发其下一代AI模型。
研究人员提出无监督在线策略自蒸馏(U-OPSD),该方法仅利用模型自身的生成结果,无需外部监督即可实现大语言模型的训练后性能提升。该方法通过采样多个 rollout 构建伪解(基于多数投票),然后将教师分布蒸馏到模型最长错误完成序列的前缀中。
苹果为其第三代基础模型(AFM3)引入了一种新架构,利用“指令跟随剪枝”大幅减少活跃参数数量。该模型设计为每次提示仅进行一次路由决策,从而激活其 MLP 层的大约 20%,而非每个 token 一次。
NVIDIA 的 NeMo 团队发布了 Molt,这是一个开源的智能体强化学习框架,旨在降低研究人员进行算法迭代的复杂性。代码库包含约 8.6K 行 RL 代码,显著小于 comparable frameworks like verl (62K lines) and slime (25K lines).
作者提出一个假设:失败的调用工具智能体轨迹(例如错误的工具选择或格式错误的参数)可以作为有价值的微调数据,用于训练模型避免此类错误。该帖子旨在征求社区反馈,了解基于修正后的失败轨迹进行训练是有效还是有害。
PIN架构v2引入了一种在训练前通过权重绑定预先选择神经网络大小和推理速度的方法。该技术强制一组单元保持相同的值,使网络能够在大幅减少存储权重的同时维持其宽度。