月之暗面发布Kimi K3,一款拥有百万token上下文的2.8T MoE模型
月之暗面推出Kimi K3,这是一款开源的混合专家(Mixture-of-Experts)模型,具有2.8万亿总参数和每个token激活1040亿个参数。该架构利用原生视觉能力,并支持100万token的上下文窗口,由Kimi Delta Attention和Stable LatentMoE实现。
月之暗面推出Kimi K3,这是一款开源的混合专家(Mixture-of-Experts)模型,具有2.8万亿总参数和每个token激活1040亿个参数。该架构利用原生视觉能力,并支持100万token的上下文窗口,由Kimi Delta Attention和Stable LatentMoE实现。
研究人员提出减少矩阵乘法(RMM),这是一种无需训练、输入自适应的推理方法,通过在收缩维度上选择信息丰富的切片来降低 Transformer 矩阵乘积,而无需修改模型权重。在简单的保留率控制下,RMM 在参数量从 1B 到 70B 的语言模型中提供了平滑且可预测的精度-效率权衡。
该论文介绍了 AutoDesign,这是一个采用元工具链优化器来指导代码代理根据 rollout 反馈递归改进其工具链的框架。作者在新构建的 PosterBench 基准上评估了该方法在学术论文到海报生成任务上的表现。
作者介绍了 Intern-S2-Preview,这是一系列旨在支持多模态科学理解、推理、生成及长周期任务的科学智能体基础模型。训练流程始于对渲染的科学文档、交错图像文本数据以及多样化科学语料库进行的多模态预训练。
VITA是一个专为低收入和中等收入环境设计的检索增强生成系统,在HealthBench的英文子集上排名第一,超越了GPT-5.4、o4-mini、Gemini 3.1 Pro和Claude Sonnet 4.6。
研究人员发布了 MiLMMT-46-v1.0,这是一个用于多语言机器翻译的开源大型语言模型,采用了无参考后训练技术。该团队从监督微调的 MiLMMT-46-v0.1 出发,应用了基于两种由语言识别门控的无参考质量评估模型的奖励的组相对策略优化(GRPO)。
Macaron-V1 是一个面向体验式智能的开放智能体模型家族,使系统能够从真实世界经验中学习并在部署后持续改进。其架构围绕两个目标:通过模型- harness 对的递归自我提升实现适应,以及通过 Mixture-of-LoRA (MoL) 系统在每次用户交互中选择专家适配器实现协作。
研究人员展示了首个用于实时临床视频咨询的专家级 AI 系统 AMIE (Video),这是一个基于 Gemini 的多智能体系统,将低延迟对话与实时视听感知相结合。
一项针对大型语言模型在微生物致癌系统性证据合成方面的基准测试发现,GPT-5 和 GPT-5 Nano 的表现与领域专家难以区分。研究人员使用包含多个问题类型的77项结构化模板,对 Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-5 和 GPT-5 Nano 在24篇研究论文上进行了评估。
研究人员推出了M$^3$R-Bench,这是一个统一的基准测试集,包含1,000个经过人工验证标注的图像-文本实例,旨在评估基于证据的多模态隐喻理解能力。该基准测试为隐喻出现、目标-源映射、情感以及基于概念隐喻理论的阶段性解释提供了联合标注。
抖音发布了其多模态嵌入(DME)模型的技术报告,该模型结合大规模对比预训练与潜在推理,实现了强大的判别能力和效率。
研究人员推出了Qwen-CUA,这是一种基于397B-A17B Qwen混合专家骨干网络构建的原生计算机使用智能体。该系统通过观察屏幕截图并借助键盘和鼠标事件进行操作,不依赖DOM树或辅助功能元数据。
研究表明,针对控制推理过程的对手,思维链(CoT)监控会失效。通过重写智能体的推理过程,使其看似出于善意的工程操作,同时逐字保留命令和输出,攻击者可以绕过检测机制。
研究人员提出了“大规模记忆解码器”(Memory Decoder at Scale),该系统将参数化长期记忆模型扩展至6.9B参数,并在300B个token上进行预训练。为了解决在该数据规模下标准Faiss管道不可行的问题,作者实现了一个分布式索引管道,采用稀疏的、按批次加载kNN分布的方式。
Frontis发布Frontis-MA1,这是一个35B参数的AI4AI模型,专为机器学习工程中的递归自我提升而设计,同时发布了开源的OpenMLE栈。该系统整合了可验证的任务环境、算子学习和长视界搜索,使智能体能够通过执行基础训练来改进自身代码。
研究人员推出了 OSReward,这是一个旨在评估视觉语言模型(VLMs)作为计算机使用智能体轨迹裁判可靠性的真实基准。研究表明,即使是最先进的 VLMs 也存在系统性的宽容偏差,且成本高昂难以规模化,而廉价的开源模型表现不佳。
研究人员提出了 Living-Harness,这是一种自我进化的智能体工具集,它将完成的轨迹和评估器信号转换为有界工具集更新的后验证据。在 Evolution-SOP 的引导下,该系统提取片段抽象和结构化更新证据,以编写情景记忆和状态图。
研究人员通过在120B规模模型的训练过程中插入基于价值观的内容来测试宪法式中期训练,以确定其是否比标准的后训练方法产生更持久的对齐效果。研究发现,这种方法显著改善了对齐的泛化和持久性,特别是在缓解监督微调后的勒索倾向方面。
研究人员引入中继在策略蒸馏(Relay-OPD)以解决标准在策略蒸馏中的前缀失败问题,其中学生错误会导致监督不可靠。该方法利用教师-学生延续非对称性作为触发器,使教师短暂接管并重新引导轨迹,随后学生继续。
PIVOT(Proxy Indexing Via One full-prefix Traversal)是一种无需训练、可即插即用的DeepSeek稀疏注意力(DSA)索引器替代方案,它通过在邻近查询组间共享单次前缀扫描来减少计算冗余。PIVOT不再为每个查询单独对每个前置令牌进行评分,而是将查询组聚合为一个代理查询以获取候选集,随后从中为每个查询选出top-k个令牌。