El proyecto llama.cpp lanzó la versión 0.4.1, introduciendo soporte para la arquitectura ternaria de Mezcla de Expertos (MoE) Maple 20B-A1B en CPU, así como soporte preliminar para los modelos Tencent Hy 4 y Spark2.5.
- Añadido soporte para la arquitectura MoE ternaria Maple 20B-A1B (CPU).
- Añadido soporte preliminar para la arquitectura Tencent Hy 4 (hy_v4).
- Añadido soporte para el modelo Spark2.5.
- Actualizado ggml a v0.24.0, ampliando la cobertura del backend y la robustez con una nueva API de control de precisión.
- Mejorada la manipulación del esquema JSON mediante su refactorización con una representación interna common_schema.
- Divididos los analizadores especializados de chat en common/parsers y añadido registro JSONL estructurado mediante --log-jsonl.
- Corregida la asignación de caché KV del contexto MTP para modelos DeepSeek2, GLM-MoE y relacionados.
- Corregida la normalización GDN de max a rsqrt para los modelos Qwen/Kimi/GLM afectados.
Esta versión permite ejecutar nuevas arquitecturas de modelos y mejora la estabilidad mediante la corrección de la normalización, la asignación de caché y la gestión de procesos hijos del servidor.