La versión b10338 de llama.cpp resuelve un error crítico en el guardador de modelos que provocaba que los modelos Mixture-of-Experts (MoE) con expertos compartidos fallaran al cargarse después de ser guardados. El problema se originó porque el guardador escribía incorrectamente el valor `n_ff_chexp` en la clave `LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH`, lo que sobrescribía la información correcta de la forma del tensor.

  • La corrección asegura que la segunda llamada escriba la clave correcta `LLM_KV_EXPERT_CHUNK_FEED_FORWARD_LENGTH` en lugar de sobrescribir la longitud de alimentación hacia adelante compartida.
  • Esto resuelve las fallas de carga para arquitecturas con expertos compartidos, incluyendo qwen2moe, qwen3-next, granite-moe, hunyuan-moe, ernie4.5, bailingmoe2 y nemotron-h.
  • La versión incluye binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) y openEuler.

Esta corrección asegura que los ciclos de guardado y carga para modelos MoE con expertos compartidos tengan éxito sin desajustes en la forma del tensor.