연구자들은 총 1조 개의 파라미터 중 320억 개가 활성화되는 Mixture-of-Experts 대규모 언어 모델인 Kimi K2를 소개합니다. 이 모델은 15.5조 개의 토큰으로 사전 훈련하는 동안 토큰 효율성을 유지하면서 훈련 불안정성을 해결하기 위해 새로운 MuonClip 옵티마이저를 활용합니다.

  • Kimi K2는 Tau2-Bench에서 66.1점, ACEBench(En)에서 76.5점을 기록하여 오픈 소스 비사고(non-thinking) 모델 중 최상위 성능을 달성합니다.
  • SWE-Bench Verified에서 65.8점, SWE-Bench Multilingual에서 47.3점을 획득하여 비사고 설정에서 대부분의 오픈 및 클로즈드 소스 기준선을 능가합니다.
  • LiveCodeBench v6에서 53.7점, AIME 2025에서 49.5점, GPQA-Diamond에서 75.1점을 기록하며 코딩과 추론에서 강력한 능력을 보여줍니다.

사후 훈련에는 에이전트 데이터의 대규모 합성과 결합 강화 학습을 포함한 다단계 과정이 포함되어 에이전트 능력을 향상시킵니다.

베이스 및 사후 훈련된 모델 체크포인트의 공개은 에이전트 지능의 향후 연구와 응용을 촉진하는 것을 목표로 합니다.