Proyek llama.cpp merilis build b10174, memperkenalkan dukungan decoding spekulatif NextN/MTP untuk arsitektur model GLM_DSA (GLM-5.2).

  • Menambahkan GLM-5.2 NextN/MTP sebagai target --spec-type draft-mtp, mengaktifkan perhatian MLA padat dan pengaturan KV konteks MTP.
  • Memperbarui skrip konversi untuk mendukung ekspor --mtp/--no-mtp untuk GlmMoeDsaForCausalLM, memungkinkan pengguna untuk membuang atau menyimpan blok NextN selama ekspor.
  • Menyediakan binari pra-bangun untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL), dan platform openEuler.

Pembaruan ini memungkinkan kecepatan inferensi yang lebih cepat untuk model GLM-5.2 dengan memanfaatkan teknik decoding spekulatif dalam kerangka kerja llama.cpp.