La version llama.cpp b10338 résout un bug critique dans le module de sauvegarde des modèles qui empêchait le chargement des modèles Mixture-of-Experts (MoE) à experts partagés après leur sauvegarde. Le problème provenait du fait que le module de sauvegarde écrivait incorrectement la valeur `n_ff_chexp` dans la clé `LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH`, ce qui écrasait les informations correctes sur la forme des tenseurs.

  • La correction garantit que le second appel écrit la clé correcte `LLM_KV_EXPERT_CHUNK_FEED_FORWARD_LENGTH` au lieu d'écraser la longueur de l'alimentation avant partagée.
  • Cela résout les échecs de chargement pour les architectures avec experts partagés, y compris qwen2moe, qwen3-next, granite-moe, hunyuan-moe, ernie4.5, bailingmoe2 et nemotron-h.

La version inclut des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) et openEuler.

Cette correction garantit que les cycles de sauvegarde et de chargement des modèles MoE avec experts partagés réussissent sans incohérences de forme des tenseurs.