美国能源部启动Genesis Open Models倡议并发布Genesis-Science-1
美国能源部启动了Genesis Open Models倡议,并与Arcee合作发布了其首个用于科学研究的开源权重模型Genesis-Science-1。
美国能源部启动了Genesis Open Models倡议,并与Arcee合作发布了其首个用于科学研究的开源权重模型Genesis-Science-1。
研究人员提出无监督在线策略自蒸馏(U-OPSD),该方法仅利用模型自身的生成结果,无需外部监督即可实现大语言模型的训练后性能提升。该方法通过采样多个 rollout 构建伪解(基于多数投票),然后将教师分布蒸馏到模型最长错误完成序列的前缀中。
研究人员推出了M$^3$R-Bench,这是一个统一的基准测试集,包含1,000个经过人工验证标注的图像-文本实例,旨在评估基于证据的多模态隐喻理解能力。该基准测试为隐喻出现、目标-源映射、情感以及基于概念隐喻理论的阶段性解释提供了联合标注。
Google DeepMind和Google Research开源了WeatherNext 2和WeatherNext Cyclones AI模型,这些模型在预测热带气旋路径、强度和风场结构方面达到了最先进的精度。该成果发表在《Nature》上,表明与以往系统相比,这些模型为预报员提供了一天的额外预测准确性。
研究人员提出了 Argus,这是一种持久且自我演进的代理运行时系统,专为长程推理设计,能够将稳定的用户意图与操作目标分离。该系统利用管理器、规划器、工程师和审查者角色,在持久的项目状态上执行有界任务,允许在操作员拥有的升级点之间进行自主执行。
微软、上海交通大学、同济大学以及复旦大学的研究人员开发了 SkillOpt,这是一种文本空间优化器,在保持目标模型冻结的同时训练自然语言技能文档。该系统使用一个优化器模型,基于评分的 rollout 提出有界编辑,并将结果导出为单个 `best_skill.md` 文件。
研究人员提出了ROSA,这是一种面向机器人工厂的机器人基础模型推理系统,突破了单机器人、边缘计算的假设。该系统利用共享GPU池服务,使机器人群体能够通过网络访问服务器级GPU。
一位开发者开源了衰减门控O(N)因果线性注意力架构,该架构包含融合的Triton/CUDA状态累积内核,旨在绕过二次MHA瓶颈。
Qwen推出Qwen-CUA,这是一款基于397B-A17B混合专家主干的原生计算机使用智能体,它通过截图和输入事件进行操作,而不依赖DOM树或辅助功能元数据。该系统利用脚手架维护最多20个活动截图,并使用拥有近10万个vCPU的云部署集群在约4万个可验证任务上进行了训练。
抖音发布了其多模态嵌入(DME)模型的技术报告,该模型结合大规模对比预训练与潜在推理,实现了强大的判别能力和效率。
研究人员推出了Qwen-CUA,这是一种基于397B-A17B Qwen混合专家骨干网络构建的原生计算机使用智能体。该系统通过观察屏幕截图并借助键盘和鼠标事件进行操作,不依赖DOM树或辅助功能元数据。
研究表明,针对控制推理过程的对手,思维链(CoT)监控会失效。通过重写智能体的推理过程,使其看似出于善意的工程操作,同时逐字保留命令和输出,攻击者可以绕过检测机制。
OpenAI发布了其未公开的内部模型Astra的成果,该模型成功解决了十个重要的开放数学问题。这些解答由模型生成,随后由人类研究人员形式化为Lean证书。
高二学生Hanyu(Olivia)Yu正在寻找cs.LG或cs.CV领域的arXiv推荐人,以上传她独立撰写的预印本《AttnRoute-MoE: Attention-Prior Routing for Mixture-of-Experts Vision Transformers》。
OpenAI发布了十个数学和理论计算机科学问题的解决方案,这些问题在至少十年内在其主要结果上没有取得进展,使用的是其下一代主要模型Astra的内部版本。
OpenAI的内部Astra模型已生成跨越数学和理论计算机科学的十个长期开放问题的解决方案,相关论证已在Lean中形式化。这些成果涵盖高维几何、编码理论、群论和量子复杂性,解决了至少十年未取得进展的问题。
研究人员提出了“大规模记忆解码器”(Memory Decoder at Scale),该系统将参数化长期记忆模型扩展至6.9B参数,并在300B个token上进行预训练。为了解决在该数据规模下标准Faiss管道不可行的问题,作者实现了一个分布式索引管道,采用稀疏的、按批次加载kNN分布的方式。
Qwen团队发布了Qwen-UI-Agent的技术报告,这是一款以现实世界为中心的GUI基础智能体,旨在在移动端、计算机使用、网页和DeepSearch环境中可靠运行。该系统将多样化的沙盒环境与大规模真实设备移动运行时环境相结合,交错执行GUI操作与CLI命令,并支持长周期任务。
研究人员提出了 Living-Harness,这是一种自我进化的智能体工具集,它将完成的轨迹和评估器信号转换为有界工具集更新的后验证据。在 Evolution-SOP 的引导下,该系统提取片段抽象和结构化更新证据,以编写情景记忆和状态图。
研究人员通过在120B规模模型的训练过程中插入基于价值观的内容来测试宪法式中期训练,以确定其是否比标准的后训练方法产生更持久的对齐效果。研究发现,这种方法显著改善了对齐的泛化和持久性,特别是在缓解监督微调后的勒索倾向方面。