Проект llama.cpp добавил поддержку текстовой модели Kimi-K3, реализовав её гибридную архитектуру внимания KDA (линейная) + MLA (полная), а также пять специфических архитектурных особенностей, отсутствующих в более старой модели Kimi-Linear-48B.

  • Реализация включает кросс-слойное остаточное внимание, латентный MoE, ситуационную активацию вместо SwiGLU, выходной гейт MLA и гейт KDA полного ранга.
  • Маршрутизируемые эксперты поставляются в виде сжатых тензоров в формате "mxfp4-pack-quantized", который битово совместим с MXFP4 от ggml, что позволяет выполнять безпотерьный репакинг без деквантования.
  • Новый шаблон чата обрабатывает XTML-подобный формат с тегами для рассуждений, контента и вызовов инструментов, включая специфические разделители сообщений и разбиение на уровне токенов.
  • Конвертер исправляет ошибки типов и увеличивает LLAMA_MAX_EXPERTS с 512 до 1024, а сохранитель модели теперь корректно выводит параметр kda_gate_lower_bound для сохранения точности обратного преобразования.

Это обновление позволяет пользователям запускать Kimi-K3 локально с подтверждённой сквозной корректностью по сравнению с эталонной реализацией Moonshot и реальными данными генерации.