月之暗面发布Kimi K3:拥有2.8万亿参数的MoE模型,支持百万token上下文
Moonshot AI推出了Kimi K3,这是一个开源的混合专家(Mixture-of-Experts)模型,总参数量为2.8万亿,每个token激活1040亿参数。该模型原生支持视觉能力,并具备100万token的上下文窗口,通过利用Kimi Delta Attention和Stable LatentMoE技术,其扩展效率较前代模型Kimi K2提升了约2.5倍。
Moonshot AI推出了Kimi K3,这是一个开源的混合专家(Mixture-of-Experts)模型,总参数量为2.8万亿,每个token激活1040亿参数。该模型原生支持视觉能力,并具备100万token的上下文窗口,通过利用Kimi Delta Attention和Stable LatentMoE技术,其扩展效率较前代模型Kimi K2提升了约2.5倍。
研究人员开发了 Replica,一个用于论文复现的可扩展任务空间,以满足对可靠科学知识的需求。他们对 Faraday(一个使用编码代理作为工具的 27B 参数 "AI Scientist" 代理)进行了后训练,以利用此环境。
作者介绍了 Intern-S2-Preview,这是一系列旨在支持多模态科学理解、推理、生成和长周期任务的科学智能体基础模型。训练流程始于对渲染的科学文档、交错图像文本数据以及多样化科学语料库的多模态预训练。
一个专为低收入和中收入环境设计的名为VITA的专用检索增强生成(RAG)系统,在HealthBench基准测试中与通用大型语言模型进行了评估。在由GPT-4.1裁判评分的4,023个问题中,VITA以51.9%的准则得分排名第一,超越了GPT-5.4、o4-mini、Gemini 3.1 Pro和Claude Sonnet 4.6。
Macaron-V1 是一个面向体验式智能的开放智能体模型家族,支持从真实环境中学习并在部署后持续学习。该系统聚焦于两个目标:通过递归优化模型-环境对实现自适应,以及借助 Mixture-of-LoRA (MoL) 架构在每次用户交互中选择专用 LoRA 适配器以实现协作。
研究人员发现,主要的大语言模型提供商在处理逐步推理轨迹方面存在漏洞,这些轨迹以加密块的形式返回供客户端使用。他们发现,这些加密块在同一提供商生态系统内的不同会话、用户和模型之间完全兼容且可互换。
研究人员提出无监督在线策略自蒸馏(U-OPSD),该方法仅利用模型自身的生成结果,无需外部监督即可实现大语言模型的训练后性能提升。该方法通过采样多个 rollout 构建伪解(基于多数投票),然后将教师分布蒸馏到模型最长错误完成序列的前缀中。
Qwen推出Qwen-CUA,这是一款基于397B-A17B混合专家主干的原生计算机使用智能体,它通过截图和输入事件进行操作,而不依赖DOM树或辅助功能元数据。该系统利用脚手架维护最多20个活动截图,并使用拥有近10万个vCPU的云部署集群在约4万个可验证任务上进行了训练。
研究人员推出了 SkewAdam,这是一种专为混合专家(MoE)模型设计的优化器,它向不同的参数群体分配不同类型的状态,从而大幅降低内存使用量。通过将 float32 动量和分解的二阶矩分配给主干网络,将分解的二阶矩分配给专家,并将精确的二阶矩分配给路由器,SkewAdam 将 6.78B 参数模型的优化器状态从 50.6 GB 减少到 1.29 GB。
研究人员推出了RoboTTT,这是一种训练方案,可将机器人基础模型的视觉运动上下文扩展至8,000个时间步,同时不增加推理延迟。该方法通过将测试时训练(Test-Time Training)整合到视觉-语言-动作(Vision-Language-Action)策略中,利用在训练和推理期间通过梯度下降更新的高速权重来实现。