Выпуск llama.cpp b10338 устраняет критическую ошибку в модуле сохранения моделей, из-за которой модели Mixture-of-Experts (MoE) с общими экспертами не загружались после сохранения. Проблема заключалась в том, что сохранение неправильно записывало значение `n_ff_chexp` в ключ `LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH`, что приводило к искажению корректной информации о форме тензора.
- Исправление гарантирует, что второй вызов записывает корректный ключ `LLM_KV_EXPERT_CHUNK_FEED_FORWARD_LENGTH` вместо перезаписи длины общего прямого распространения.
- Это устраняет сбои загрузки для архитектур с общими экспертами, включая qwen2moe, qwen3-next, granite-moe, hunyuan-moe, ernie4.5, bailingmoe2 и nemotron-h.
- В выпуск включены бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) и openEuler.
Это исправление гарантирует успешное выполнение круговых операций сохранения и загрузки для моделей MoE с общими экспертами без несоответствий формы тензоров.