O projeto llama.cpp lançou a compilação b11060, que inclui uma correção para o modelo Mamba para garantir que a entrada da projeção do passo de tempo seja contígua. Esta alteração aborda problemas de layout de memória na implementação do Mamba.

  • O módulo Mamba agora torna a entrada da projeção do passo de tempo contígua para evitar erros.
  • Uma otimização subsequente pula a operação de cópia contígua após a normalização no caminho do Mamba.
  • A versão fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.

Esta atualização garante a estabilidade para modelos baseados em Mamba, mantendo amplo suporte de hardware no ecossistema llama.cpp.