Proyek llama.cpp merilis versi b10247, yang menangani masalah stabilitas saat memuat model Mixture of Experts (MoE) besar pada pengaturan multi-backend. Pembaruan ini menggantikan array berukuran tetap dalam penjadwal backend dengan buffer yang dialokasikan secara dinamis untuk menangani pemisahan grafik yang melebihi 30 tensor input.
- Menggantikan GGML_SCHED_MAX_SPLIT_INPUTS dengan alokasi dinamis untuk input grafik terpisah.
- Memperbaiki crash saat memuat model MoE lebar seperti Gemma 4, Qwen MoE, Mixtral, dan DeepSeek.
- Memperbarui perhitungan graph_size untuk menggunakan jumlah input aktual alih-alih konstanta tetap.
- Menyediakan biner untuk macOS (Apple Silicon/Intel), Linux (CPU/Vulkan/ROCm/OpenVINO/SYCL), Windows (CPU/CUDA/Vulkan/OpenVINO/SYCL/HIP), Android, dan iOS.
Perubahan ini memungkinkan pengguna menjalankan arsitektur MoE kompleks tanpa mengalami crash terkait penjadwalan pada sistem dengan beberapa perangkat backend.