Le projet llama.cpp a publié la version 0.4.1, introduisant le support de l'architecture ternaire Mixture of Experts Maple 20B-A1B sur CPU, ainsi qu'un support en aperçu pour les modèles Tencent Hy 4 et Spark2.5.

  • Ajout du support de l'architecture MoE ternaire Maple 20B-A1B (CPU).
  • Ajout du support en aperçu de l'architecture Tencent Hy 4 (hy_v4).
  • Ajout du support du modèle Spark2.5.
  • Mise à jour de ggml vers la v0.24.0, élargissant la couverture des backends et la robustesse avec une nouvelle API de contrôle de précision.
  • Amélioration de la gestion du schéma JSON par sa refonte avec une représentation interne common_schema.
  • Séparation des analyseurs de chat spécialisés dans common/parsers et ajout d'une journalisation JSONL structurée via --log-jsonl.
  • Correction de l'allocation du cache KV du contexte MTP pour DeepSeek2, GLM-MoE et les modèles associés.
  • Correction de la normalisation GDN passant de max à rsqrt pour les modèles Qwen/Kimi/GLM concernés.

Cette version permet d'exécuter de nouvelles architectures de modèles et améliore la stabilité grâce à une normalisation corrigée, une allocation du cache et une gestion des processus enfants du serveur.