上下文语言模型以可编辑文件的形式原生管理上下文
研究人员引入了上下文语言模型(CLM),这是一种新架构,将模型的上下文窗口视为可编辑的文件,允许模型对其自身记忆进行无限制的更新。这种方法将上下文管理从外部控制框架转移到模型内在行为,实现了上下文管理策略的上下文中学习和参数化学习。
研究人员引入了上下文语言模型(CLM),这是一种新架构,将模型的上下文窗口视为可编辑的文件,允许模型对其自身记忆进行无限制的更新。这种方法将上下文管理从外部控制框架转移到模型内在行为,实现了上下文管理策略的上下文中学习和参数化学习。
研究人员调查了仅回顾式微调(Retrospection-Only Fine-Tuning, ROFT),这是一种极简的在线过程,其中智能体生成对其自身经验的回顾性解释,并仅使用这些解释标记上的下一个标记预测损失进行微调。该方法不需要外部教师或基于奖励的策略更新。
一位分享基于logits的知识蒸馏探索性工作的研究人员正在向社区寻求真实的行业经验和工程见解。
VHD-Play 是一个流水线,通过对数学模型进行采样和求解,并将其决策过程呈现为有状态工具,从而生成多样化的代理式强化学习环境。该方法确保可执行动态和轨迹评分参考直接继承自已解模型,解决了现有生成流水线中常见的对齐问题。
研究人员推出了SkillGym,这是一个框架,可将人工编写的智能体技能转化为可执行、可验证的大语言模型智能体训练环境。该系统利用技能到任务(skill-to-task)流水线实例化具体任务,并通过基于代码的检查器验证结果。
Together AI 发布了一份指南和一个开源仓库,用于使用 Qwen3.5 4B 基础模型微调类似于 Jev 的分类模型。
基于 NVIDIA Warp 构建的 MuJoCo Warp (MJWarp) 允许兼容的 MuJoCo 模型在 GPU 规模上运行,从而在一次调用中推进数百或数千个独立仿真世界的进展。这种架构将重点从最小化单个环境的延迟转移到提高聚合吞吐量,这有利于强化学习和大规模采样。
SplitMoE是一种替代性的混合专家(Mixture of Experts)架构,它将宽泛的前馈层分解为更小的、专门的子组件,以提高令牌表示的灵活性和计算模块化。
世界状态生成器(WSG)是一种模型,通过在失败后重写状态,使语言智能体的计划与其执行环境的规则保持一致。它在从七个合成领域提取的226K条轨迹上进行训练,在这些领域中,程序强制执行规则并验证目标可达性。
作者介绍了 Fathom-Vaidya,这是一个拥有 30B 参数的模型,它使用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理。训练框架首先对来自 MedBullets 的诊断问题应用规则引导的 RL,然后利用具有多维量表的 5.3k 合成多轮场景进行交互式临床任务。
Jen Wei 在为即将到来的 PyTorch 会议演讲测试 AdamW、Muon 以及 OLMo-core 中最新的 Dion3 实现时,遇到了学习率死亡螺旋。
作者介绍了Fathom-Vaidya,这是一个拥有30B参数的模型,它使用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理。训练框架首先针对使用MedBullets派生问题的诊断准确性,然后通过具有多维量表的5.3k个生成场景解决多轮临床交互。
作者介绍了 Fathom-Vaidya,这是一个拥有 30B 参数的模型,它利用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理能力。
TypeSafe AI 推出了 Jev,这是一类专为生产环境设计的“System One”模型。该公司首席执行官、InstructGPT 论文的共同作者 Diogo Almeida 指出,当前的前沿模型将重点放在了对齐和拒绝响应上,而非可靠性,这导致了幻觉和谄媚等问题。
MB-Bidram 发布了一个名为 WideNDepth (WND) 的实验性神经网络架构,旨在将推理能力与知识存储分离。该模型由一个作为内存的“Wide 部分”和一个作为推理器的“Depth 部分”组成。
Hugging Face上的一项提案讨论了AI中的两个相互关联的问题:对训练独立大型模型的依赖,以及生态系统对通用GPU的依赖。
Hugging Face 论坛上的用户提出了一项渐进式知识转移的实验,其中固定大小的学生模型(Qwen 4B)依次从越来越大的教师模型中学习,而不是直接从最大的可用模型中学习。
OpenAI推出了一套用于跟踪、调查和披露其模型中不对齐问题的新框架,并附带了来自强化学习训练的六份详细事件报告。该体系为公开披露设定了具体的标准和截止日期,即使相关行为尚未得到完全解释或缓解,也适用。
ByteLex 研究人员从 11 个分词器词汇表中构建了坐标空间,以预测其字节级语言模型会在哪些虚构的单词上失败。该映射与模型测量的逐词准确率达到了 -0.98 的斯皮尔曼相关系数,优于基于语料库的统计信息。
OpenAI 发布了 Open-1B,这是一种语言模型,其训练过程中的每一步操作都可以在异构商用硬件上以比特级精度独立复现。这种方法通过为 GPU 内核归约和数据批次排序等不确定性来源施加明确的顺序,解决了开源模型固有的可复现性问题。