SplitMoE引入细粒度专家路由以减少参数冗余
SplitMoE是一种替代性的混合专家(Mixture of Experts)架构,它将宽泛的前馈层分解为更小的、专门的子组件,以提高令牌表示的灵活性和计算模块化。
SplitMoE是一种替代性的混合专家(Mixture of Experts)架构,它将宽泛的前馈层分解为更小的、专门的子组件,以提高令牌表示的灵活性和计算模块化。
世界状态生成器(WSG)是一种模型,通过在失败后重写状态,使语言智能体的计划与其执行环境的规则保持一致。它在从七个合成领域提取的226K条轨迹上进行训练,在这些领域中,程序强制执行规则并验证目标可达性。
作者介绍了 Fathom-Vaidya,这是一个拥有 30B 参数的模型,它使用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理。训练框架首先对来自 MedBullets 的诊断问题应用规则引导的 RL,然后利用具有多维量表的 5.3k 合成多轮场景进行交互式临床任务。
Jen Wei 在为即将到来的 PyTorch 会议演讲测试 AdamW、Muon 以及 OLMo-core 中最新的 Dion3 实现时,遇到了学习率死亡螺旋。
作者介绍了Fathom-Vaidya,这是一个拥有30B参数的模型,它使用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理。训练框架首先针对使用MedBullets派生问题的诊断准确性,然后通过具有多维量表的5.3k个生成场景解决多轮临床交互。
作者介绍了 Fathom-Vaidya,这是一个拥有 30B 参数的模型,它利用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理能力。
TypeSafe AI 推出了 Jev,这是一类专为生产环境设计的“System One”模型。该公司首席执行官、InstructGPT 论文的共同作者 Diogo Almeida 指出,当前的前沿模型将重点放在了对齐和拒绝响应上,而非可靠性,这导致了幻觉和谄媚等问题。
MB-Bidram 发布了一个名为 WideNDepth (WND) 的实验性神经网络架构,旨在将推理能力与知识存储分离。该模型由一个作为内存的“Wide 部分”和一个作为推理器的“Depth 部分”组成。
Hugging Face上的一项提案讨论了AI中的两个相互关联的问题:对训练独立大型模型的依赖,以及生态系统对通用GPU的依赖。
Hugging Face 论坛上的用户提出了一项渐进式知识转移的实验,其中固定大小的学生模型(Qwen 4B)依次从越来越大的教师模型中学习,而不是直接从最大的可用模型中学习。
OpenAI推出了一套用于跟踪、调查和披露其模型中不对齐问题的新框架,并附带了来自强化学习训练的六份详细事件报告。该体系为公开披露设定了具体的标准和截止日期,即使相关行为尚未得到完全解释或缓解,也适用。
ByteLex 研究人员从 11 个分词器词汇表中构建了坐标空间,以预测其字节级语言模型会在哪些虚构的单词上失败。该映射与模型测量的逐词准确率达到了 -0.98 的斯皮尔曼相关系数,优于基于语料库的统计信息。
OpenAI 发布了 Open-1B,这是一种语言模型,其训练过程中的每一步操作都可以在异构商用硬件上以比特级精度独立复现。这种方法通过为 GPU 内核归约和数据批次排序等不确定性来源施加明确的顺序,解决了开源模型固有的可复现性问题。
TRL v1.14 为 AsyncGRPOTrainer 引入了 LoRA 支持,使其能够训练低秩适配适配器,并仅将该小文件同步到 vLLM 推理工作节点。该架构通过使用共享存储桶作为文件系统桥接,将不同机器上的训练和生成作业解耦,消除了节点间对 NCCL 或直接网络通信的需求。
用户 pop123-ux 发布了一个学习仓库,其中包含 38 个可运行的笔记本,旨在通过逐步移除高级抽象来帮助理解 Hugging Face 技术栈。该集合涵盖了从 transformers 和 tokenizers 等核心组件到微调、PEFT、推理/RL 以及端到端项目工作的路径。
Together AI 已扩展其微调服务,以支持更广泛的开源权重模型,包括 GLM-5.3 和 Kimi K2.7,同时引入实时实验跟踪以及对训练过程的更精细控制。
来自Google和几所日本大学的研究人员推出了ToolGrad,该框架通过先构建经过验证的API链,再编写匹配的用户查询,从而逆转了传统工具使用数据集生成的流程。这种方法旨在消除基于查询优先的方法在智能体探索过程中经常出现的低效问题。
研究人员推出了ExecCritic,这是一个将测试-验证-修订框架与角色特定的强化学习相结合,以增强编码智能体的框架。该系统将测试构建与源代码修复分离,使用Test智能体生成仓库原生测试,并使用Repair智能体根据执行反馈修订代码。
memaudit 是一个与 TRL 库集成的工具,用于验证在私有数据上微调模型是否导致了记忆化。它通过将校准的诱饵秘密注入数据集并监控训练过程中的损失来工作。
演示表明,冻结引导文本的键值 (KV) 状态允许 Qwen2.5-3B-Instruct 模型在不将引导内容包含在实时提示中的情况下应用新指令。该方法涉及让引导文本通过模型一次,冻结其 KV 缓存,然后在该隐藏前缀之上生成响应。