U-OPSD 实现大语言模型的无监督在线策略自蒸馏
研究人员提出无监督在线策略自蒸馏(U-OPSD),该方法仅利用模型自身的生成结果,无需外部监督即可实现大语言模型的训练后性能提升。该方法通过采样多个 rollout 构建伪解(基于多数投票),然后将教师分布蒸馏到模型最长错误完成序列的前缀中。
研究人员提出无监督在线策略自蒸馏(U-OPSD),该方法仅利用模型自身的生成结果,无需外部监督即可实现大语言模型的训练后性能提升。该方法通过采样多个 rollout 构建伪解(基于多数投票),然后将教师分布蒸馏到模型最长错误完成序列的前缀中。
苹果为其第三代基础模型(AFM3)引入了一种新架构,利用“指令跟随剪枝”大幅减少活跃参数数量。该模型设计为每次提示仅进行一次路由决策,从而激活其 MLP 层的大约 20%,而非每个 token 一次。
NVIDIA 的 NeMo 团队发布了 Molt,这是一个开源的智能体强化学习框架,旨在降低研究人员进行算法迭代的复杂性。代码库包含约 8.6K 行 RL 代码,显著小于 comparable frameworks like verl (62K lines) and slime (25K lines).
作者提出一个假设:失败的调用工具智能体轨迹(例如错误的工具选择或格式错误的参数)可以作为有价值的微调数据,用于训练模型避免此类错误。该帖子旨在征求社区反馈,了解基于修正后的失败轨迹进行训练是有效还是有害。
PIN架构v2引入了一种在训练前通过权重绑定预先选择神经网络大小和推理速度的方法。该技术强制一组单元保持相同的值,使网络能够在大幅减少存储权重的同时维持其宽度。
华为发布了 openPangu-2.0-Pro 的开源权重,这是一款在 Ascend 硬件上训练的大型语言模型(MoE)。该模型具有 5050 亿总参数和 180 亿激活参数,支持 512k token 的上下文长度。
研究人员提出了“大规模记忆解码器”(Memory Decoder at Scale),该系统将参数化长期记忆模型扩展至6.9B参数,并在300B个token上进行预训练。为了解决在该数据规模下标准Faiss管道不可行的问题,作者实现了一个分布式索引管道,采用稀疏的、按批次加载kNN分布的方式。
微软研究院推出了EvoLib,这是一个框架,使大型语言模型能够在推理过程中从自身经验中学习,而无需真实标签或外部反馈。EvoLib不将原始经验存储为静态记忆,而是将其转化为可重用的技能和反思性见解,这些技能和见解会不断被精炼、整合和重新加权。
微软研究院发布了 Echoverse,这是一组由十二个深度合成环境组成的集合,旨在训练计算机使用代理。该计划包括十个特定领域的世界和两个以能力为中心的世界,所有这些都旨在保持连贯的状态和行为保真度。
研究人员引入中继在策略蒸馏(Relay-OPD)以解决标准在策略蒸馏中的前缀失败问题,其中学生错误会导致监督不可靠。该方法利用教师-学生延续非对称性作为触发器,使教师短暂接管并重新引导轨迹,随后学生继续。
Google 现在为其 Gemini 模型提供蒸馏服务。这允许用户通过 Google Cloud 平台将大型 Gemini 模型的能力压缩到更小、更高效的版本中。
OpenForgeRL 是一个开源框架,允许研究人员使用标准的强化学习堆栈对基于工具链的 AI 智能体进行端到端训练。它通过采用轻量级代理将模型调用记录为数据,并使用 Kubernetes 编排器在远程容器中管理 rollout,从而将训练与推理解耦。
CrowdTensor 是一项 Apache-2.0 开源协议,用于检查点化的志愿者模型训练活动,它将不可变的模型和数据修订版本固定,以便为已获准的 CPU、GPU 或 TPU 单元提供有界的工作量。该项目已发布 Beta 版注册流程以及针对 Qwen2.5-7B GSM8K 活动的 RFC 草案。
ThetaScan v0.1(一种固定状态的非线性令牌混合器)的研究预览版已作为开源实现发布。该架构确保每个令牌从其当前输入和共享参数计算其内存写入,而非依赖于不断演变的快速状态,从而允许通过结合性前缀扫描来组合写入。
研究人员推出了 OpenForgeRL,这是一个开源框架,允许使用 Claude Code 和 OpenClaw 等复杂推理工具链对 AI 代理进行端到端训练。该系统通过采用轻量级代理将模型调用记录为数据,并使用 Kubernetes 编排器管理远程容器部署,从而将训练与推理解耦。
OpenForgeRL 是一个开源框架,允许研究人员使用标准的强化学习堆栈对基于工具链的 AI 智能体进行端到端训练。它通过一个轻量级代理将训练与推理解耦,该代理将模型调用记录为数据,并由 Kubernetes 编排器管理远程容器部署。
一位Hugging Face论坛用户调查了参数量在7B–14B范围内的小型领域专用大语言模型(LLM)是否能在实际生产环境中有效替代更大的模型。
一种新的ELIZA聊天机器人实现利用稀疏自编码器架构,将对话条目存储在潜在记忆层中,旨在改进传统的关键词匹配方法。该系统采用T5编码器-解码器结构,配备32,768个神经元的记忆层,通过对比学习激活相似条目。
SLAI推出了T-Rex,这是一个针对Ascend SuperPOD基础设施上的DeepSeek-V4模型家族的完整参数后训练框架。该系统通过分层优化解决了万亿参数MoE模型的内存压力和通信开销问题。
SLAI 推出 T-Rex,这是一个端到端优化框架,用于在 Ascend NPU SuperPOD 上对万亿参数规模的 MoE 模型进行全参数后训练。以 DeepSeek-V4 模型家族为目标工作负载,该系统通过分层并行和内核执行优化来解决内存压力和通信开销问题。