A versão b10338 do llama.cpp resolve um bug crítico no salvador de modelos que causava falhas no carregamento de modelos Mixture-of-Experts (MoE) com especialistas compartilhados após serem salvos. O problema decorria do salvador gravar incorretamente o valor `n_ff_chexp` na chave `LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH`, o que corrompia as informações corretas da forma do tensor.

  • A correção garante que a segunda chamada grave a chave correta `LLM_KV_EXPERT_CHUNK_FEED_FORWARD_LENGTH` em vez de sobrescrever o comprimento feed-forward compartilhado.
  • Isso resolve falhas de carregamento para arquiteturas com especialistas compartilhados, incluindo qwen2moe, qwen3-next, granite-moe, hunyuan-moe, ernie4.5, bailingmoe2 e nemotron-h.
  • A versão inclui binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) e openEuler.

Esta correção garante que os ciclos de salvamento e carregamento para modelos MoE com especialistas compartilhados tenham sucesso sem incompatibilidades na forma do tensor.