O projeto llama.cpp lançou a versão 0.4.1, introduzindo suporte para a arquitetura ternária Mixture of Experts do Maple 20B-A1B em CPU, bem como suporte preview para os modelos Tencent Hy 4 e Spark2.5.

  • Adicionado suporte à arquitetura MoE ternária Maple 20B-A1B (CPU).
  • Adicionado suporte preview à arquitetura Tencent Hy 4 (hy_v4).
  • Adicionado suporte ao modelo Spark2.5.
  • ggml atualizado para v0.24.0, expandindo a cobertura do backend e a robustez com uma nova API de controle de precisão.
  • Melhorado o tratamento do esquema JSON por meio da refatoração com uma representação interna common_schema.
  • Divididos os analisadores especializados de chat em common/parsers e adicionado registro JSONL estruturado via --log-jsonl.
  • Corrigida a alocação do cache KV do contexto MTP para DeepSeek2, GLM-MoE e modelos relacionados.
  • Corrigida a normalização GDN de max para rsqrt para os modelos Qwen/Kimi/GLM afetados.

Este lançamento permite executar novas arquiteturas de modelos e melhora a estabilidade por meio da correção da normalização, alocação de cache e gerenciamento do processo filho do servidor.