本文概述了一系列特定的研究论文和模型报告,以帮助读者理解月之暗面(Moonshot AI)Kimi K3 模型背后的技术演进。文章认为,K3 并非孤立发布的产品,而是多条不同研究路线的交汇点,包括线性注意力机制和稀疏混合专家(MoE)设计。
- Linear Transformers Are Secretly Fast Weight Programmers:通过将线性注意力解释为更新关联记忆的系统,奠定了理论基础。
- Gated DeltaNet (arXiv:2412.06464):引入门控 delta 更新,以改善长序列的状态管理。
- Kimi Linear / Kimi Delta Attention (KDA):展示了作为 K3 主干的混合线性注意力架构。
- LatentMoE and Stable LatentMoE:详细阐述了潜在空间路由公式及其演进,这使得 K3 能够针对每个 token 激活 896 个路由专家中的 16 个。
- Attention Residuals (arXiv:2603.15031):解释了该机制如何使模型决定如何利用残差网络以实现更好的信息流动。
- Kimi Model Evolution:追溯了从 Kimi K1.5 到 K2.5 再到 K3 的演进过程,展示了每次迭代如何优化训练配方和基础设施。
遵循这一路径提供了必要的背景知识,以理解为何在 Kimi K3 中做出了特定的架构选择,而不是将其视为一个独立的产品。