本記事は、Moonshot AIのKimi K3モデルの背後にある技術的進化を理解するために、特定の研究論文とモデルレポートの具体的なシーケンスを概説しています。K3は孤立したリリースではなく、線形アテンション機構やスパースMixture-of-Experts設計など、複数の異なる研究スレッドの収束であると主張しています。

  • Linear Transformers Are Secretly Fast Weight Programmers: 連想記憶を更新するシステムとして線形アテンションを解釈することで、基盤を確立します。
  • Gated DeltaNet (arXiv:2412.06464): 長期シーケンスにわたる状態管理を改善するためのゲート付きデルタ更新を導入します。
  • Kimi Linear / Kimi Delta Attention (KDA): K3のバックボーンとなるハイブリッド線形アテンションアーキテクチャを紹介します。
  • LatentMoE and Stable LatentMoE: 潜在空間ルーティングの定式化とその進化を詳述し、これによりK3はトークンごとに896のルーティング済みエキスパートのうち16個を活性化できます。
  • Attention Residuals (arXiv:2603.15031): モデルがより良い情報フローのために残差ネットワークをどのように使用するかを決定するメカニズムを説明します。
  • Kimi Model Evolution: Kimi K1.5からK2.5を経てK3への進行を追跡し、各反復でトレーニングレシピとインフラストラクチャがどのように洗練されたかを示します。

この経路に従うことで、Kimi K3を単独の製品として見るのではなく、なぜ特定のアーキテクチャ選択が行われたのかを理解するために必要な文脈が得られます。