Rilis llama.cpp b10338 menyelesaikan bug kritis pada penampung model yang menyebabkan model Mixture-of-Experts (MoE) dengan ahli bersama gagal dimuat setelah disimpan. Masalah ini berasal dari penampung yang secara tidak benar menulis nilai `n_ff_chexp` ke kunci `LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH`, yang merusak informasi bentuk tensor yang benar.
- Perbaikan memastikan panggilan kedua menulis kunci `LLM_KV_EXPERT_CHUNK_FEED_FORWARD_LENGTH` yang benar alih-alih menimpa panjang feed-forward bersama.
- Ini menyelesaikan kegagalan muat untuk arsitektur dengan ahli bersama, termasuk qwen2moe, qwen3-next, granite-moe, hunyuan-moe, ernie4.5, bailingmoe2, dan nemotron-h.
- Rilis ini mencakup biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP), dan openEuler.
Perbaikan ini memastikan bahwa roundtrip simpan-dan-muat untuk model MoE dengan ahli bersama berhasil tanpa ketidakcocokan bentuk tensor.