Le projet llama.cpp a publié la version 0.4.1, introduisant le support de l'architecture ternaire Mixture of Experts Maple 20B-A1B sur CPU, ainsi qu'un support en aperçu pour les modèles Tencent Hy 4 et Spark2.5.
- Ajout du support de l'architecture MoE ternaire Maple 20B-A1B (CPU).
- Ajout du support en aperçu de l'architecture Tencent Hy 4 (hy_v4).
- Ajout du support du modèle Spark2.5.
- Mise à jour de ggml vers la v0.24.0, élargissant la couverture des backends et la robustesse avec une nouvelle API de contrôle de précision.
- Amélioration de la gestion du schéma JSON par sa refonte avec une représentation interne common_schema.
- Séparation des analyseurs de chat spécialisés dans common/parsers et ajout d'une journalisation JSONL structurée via --log-jsonl.
- Correction de l'allocation du cache KV du contexte MTP pour DeepSeek2, GLM-MoE et les modèles associés.
- Correction de la normalisation GDN passant de max à rsqrt pour les modèles Qwen/Kimi/GLM concernés.
Cette version permet d'exécuter de nouvelles architectures de modèles et améliore la stabilité grâce à une normalisation corrigée, une allocation du cache et une gestion des processus enfants du serveur.