이 글은 Moonshot AI의 Kimi K3 모델 뒤의 기술적 진화를 독자가 이해할 수 있도록 특정 연구 논문과 모델 보고서의 구체적인 순서를 제시합니다. K3는 고립된 출시가 아니라 선형 어텐션 메커니즘과 희소 Mixture-of-Experts 설계 등 여러 별개의 연구 스레드가 수렴한 결과라고 주장합니다.

  • Linear Transformers Are Secretly Fast Weight Programmers: 연관 메모리를 업데이트하는 시스템으로 선형 어텐션을 해석함으로써 기초를 확립합니다.
  • Gated DeltaNet (arXiv:2412.06464): 긴 시퀀스에 걸쳐 상태 관리를 개선하기 위한 게이트드 델타 업데이트를 소개합니다.
  • Kimi Linear / Kimi Delta Attention (KDA): K3의 핵심을 이루는 하이브리드 선형 어텐션 아키텍처를 제시합니다.
  • LatentMoE and Stable LatentMoE: K3가 토큰당 896개 라우팅된 전문가 중 16개를 활성화할 수 있게 하는 잠재 공간 라우팅 공식과 그 진화를 상세히 설명합니다.
  • Attention Residuals (arXiv:2603.15031): 모델이 더 나은 정보 흐름을 위해 잔여 네트워크를 어떻게 사용할지 결정할 수 있게 하는 메커니즘을 설명합니다.
  • Kimi Model Evolution: Kimi K1.5에서 K2.5를 거쳐 K3에 이르는 진행 과정을 추적하며, 각 반복에서 훈련 레시피와 인프라가 어떻게 정제되었는지 보여줍니다.

이 경로를 따르는 것은 Kimi K3를 독립적인 제품으로 보는 대신 왜 특정 아키텍처 선택이 이루어졌는지 이해하는 데 필요한 맥락을 제공합니다.