llama.cpp 프로젝트는 Kimi-K3 텍스트 모델에 대한 지원을 추가했으며, 이전의 Kimi-Linear-48B에는 없었던 하이브리드 KDA(선형) + MLA(전체) 어텐션 아키텍처와 다섯 가지 특정 아키텍처 기능을 구현했습니다.

  • 구현에는 교차 레이어 잔여 어텐션, 잠재적 MoE, SwiGLU를 대체하는 상황 활성화, MLA 출력 게이트 및 전체 순위 KDA 게이트가 포함됩니다.
  • 라우팅된 전문가들은 ggml의 MXFP4와 비트 호환성 있는 "mxfp4-pack-quantized" 형식을 사용하여 압축 텐서로 제공되며, 이를 통해 양자화 해제 없이 무손실 재패킹이 가능합니다.
  • 새로운 채팅 템플릿은 추론, 콘텐츠 및 도구 호출을 위한 Kimi-K3의 XTML-ish 태그 형식을 처리하며, 특정 메시지 구분자와 토큰 수준 스팬 분할을 포함합니다.
  • 변환기는 타입 오류를 수정하고 LLAMA_MAX_EXPERTS를 512에서 1024로 증가시키며, 모델 저장기는 이제 라운드트립 충실도를 보존하기 위해 kda_gate_lower_bound 매개변수를 올바르게 출력합니다.

이 업데이트는 사용자가 Moonshot의 참조 구현 및 실제 생성 데이터에 대한 검증된 엔드투엔드 정확성과 함께 Kimi-K3를 로컬에서 실행할 수 있도록 합니다.