O projeto llama.cpp lançou a compilação b11370, que inclui uma otimização de CUDA para fundir especialistas compartilhados na arquitetura Mixture of MoE com Quantização Vetorial (MMVQ). Esta alteração faz parte do pull request #29184 e também aborda verificações nulas de buffers e manipulação de argumentos para stride_col_dst.

  • Funde especialistas compartilhados no MMVQ para backends CUDA.
  • Adiciona verificações nulas para buffers para melhorar a estabilidade.
  • Move stride_col_dst para os argumentos de fusão.

Esta versão fornece binários atualizados para macOS, Linux, Windows, Android e iOS em vários aceleradores de hardware, incluindo CPU, Vulkan, ROCm, OpenVINO, SYCL e Snapdragon.