문샷 AI는 총 2.8조 개의 파라미터와 토큰당 1040억 개의 활성화된 파라미터를 갖춘 오픈소스 Mixture-of-Experts 모델을 선보인 Kimi K3를 소개했습니다. 이 모델은 Kimi Delta Attention과 Stable LatentMoE를 활용하여 전작인 Kimi K2 대비 약 2.5배의 확장 효율성을 달성하며 네이티브 비전 기능과 100만 토큰 컨텍스트 윈도우를 지원합니다.
- Kimi K3는 시퀀스 길이와 모델 깊이에 걸쳐 정보 흐름을 개선하기 위해 Kimi Delta Attention과 Attention Residuals를 활용합니다.
- Stable LatentMoE는 토큰당 896개 라우팅된 전문가 중 16개를 효과적으로 활성화합니다.
- 사후 훈련에는 일반, 에이전트, 코딩 도메인 전반에 걸쳐 다양한 추론 노력 수준의 강화 학습이 포함됩니다.
- 이 모델은 장기적 코딩, 에이전트, 지식, 추론 및 비전 작업에서 최첨단 수준의 성능을 달성했습니다.
- Claude Fable 5와 GPT-5.6 Sol에는 미치지 못하지만, 평가된 기타 오픈소스 및 독점 모델들을 능가합니다.
문샷 AI는 향후 연구를 촉진하고 최첨단 지능의 광범위한 배포를 가속화하기 위해 Kimi K3 모델의 전체 가중치를 공개합니다.