O projeto llama.cpp lançou a versão b11390, que inclui uma correção para uma falha de memória CUDA MMQ que ocorria quando o número de especialistas era significativamente maior que o tamanho do micro-lote.

  • Resolve uma falha de memória no backend CUDA relacionada ao manuseio de Mixture-of-Experts (MMQ).
  • Fornece binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.
  • Inclui uma versão atualizada da interface do usuário.

Esta atualização garante estabilidade para usuários que executam modelos Mixture-of-Experts em hardware CUDA, impedindo o erro específico de acesso à memória.