O projeto llama.cpp lançou a versão b10907, que inclui uma correção para a alocação de cache de chave-valor de contexto de Multi-Token Prediction (MTP). Esta atualização aborda problemas que afetam as arquiteturas deepseek2, glm4moe e cohere2moe.

  • Corrige a alocação de cache kv de contexto MTP para os modelos deepseek2, glm4moe e cohere2moe.
  • Adiciona gating de arquitetura inversa e testes abrangentes de arquitetura para filtragem de camadas MTP.
  • Reduz o comentário do filtro NextN e remove as alterações do test-llama-archs.

O lançamento fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.