El proyecto llama.cpp lanzó la versión b10907, que incluye una corrección para la asignación de caché de clave-valor de contexto de Multi-Token Prediction (MTP). Esta actualización aborda problemas que afectan a las arquitecturas deepseek2, glm4moe y cohere2moe.
- Corrige la asignación de caché kv de contexto MTP para los modelos deepseek2, glm4moe y cohere2moe.
- Añita filtrado de capas MTP con gating de arquitectura inversa y pruebas exhaustivas de arquitectura.
- Reduce el comentario del filtro NextN y elimina los cambios de test-llama-archs.
El lanzamiento proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) y openEuler.