В этой статье излагается конкретная последовательность исследовательских статей и отчетов о моделях, помогающая читателям понять техническую эволюцию модели Kimi K3 от Moonshot AI. Утверждается, что K3 не является изолированным релизом, а представляет собой схождение нескольких различных исследовательских направлений, включая механизмы линейного внимания и разреженные конструкции Mixture-of-Experts.
- Linear Transformers Are Secretly Fast Weight Programmers: Закладывает основу, интерпретируя линейное внимание как систему, обновляющую ассоциативную память.
- Gated DeltaNet (arXiv:2412.06464): Представляет затворные дельта-обновления для улучшения управления состоянием на длинных последовательностях.
- Kimi Linear / Kimi Delta Attention (KDA): Описывает гибридную архитектуру линейного внимания, которая служит основой K3.
- LatentMoE and Stable LatentMoE: Детализирует формулировку маршрутизации в латентном пространстве и ее эволюцию, что позволяет K3 активировать 16 из 896 маршрутизируемых экспертов на токен.
- Attention Residuals (arXiv:2603.15031): Объясняет механизм, позволяющий модели решать, как использовать остаточные сети для улучшения потока информации.
- Kimi Model Evolution: Отслеживает прогресс от Kimi K1.5 через K2.5 до K3, показывая, как каждая итерация уточняла рецепты обучения и инфраструктуру.
Следование этому пути предоставляет необходимый контекст для понимания того, почему в Kimi K3 были сделаны конкретные архитектурные выборы, а не рассматривать его как самостоятельный продукт.