Moonshot AIは、総パラメータ数2.8兆、1トークンあたり1040億のパラメータが活性化されるオープンソースのMixture-of-Expertsモデル「Kimi K3」を発表した。同モデルはネイティブなビジョン機能と100万トークンのコンテキストウィンドウをサポートし、Kimi Delta AttentionおよびStable LatentMoEを活用することで、前世代のKimi K2と比較して約2.5倍のスケーリング効率を実現している。
- Kimi K3はKimi Delta AttentionとAttention Residualsを利用し、シーケンス長およびモデル深さ全体での情報伝達を改善する。
- Stable LatentMoEは、1トークンあたり896のルーティング済みエキスパートのうち16個を効果的に活性化させる。
- 学習後処理には、一般領域、エージェント領域、コーディング領域における複数の推論努力レベルを含む強化学習が含まれる。
- 同モデルは、長期コーディング、エージェント、知識、推論、ビジョンの各タスクにおいて最先端レベルのパフォーマンスを達成している。
- Claude Fable 5およびGPT-5.6 Solには及ばないものの、評価された他のオープンソースおよびプロプライエタリなモデルを上回る性能を示す。
Moonshot AIは、将来の研究を促進し、最先端インテリジェンスのより広範な展開を加速するため、Kimi K3の全モデルウェイトを公開する。