Proyek llama.cpp merilis versi 0.4.1, memperkenalkan dukungan untuk arsitektur Mixture of Experts ternary Maple 20B-A1B pada CPU, serta dukungan pratinjau untuk model Tencent Hy 4 dan Spark2.5.

  • Menambahkan dukungan arsitektur MoE ternary Maple 20B-A1B (CPU).
  • Menambahkan dukungan arsitektur pratinjau Tencent Hy 4 (hy_v4).
  • Menambahkan dukungan model Spark2.5.
  • Memperbarui ggml ke v0.24.0, memperluas cakupan backend dan ketahanan dengan API kontrol presisi baru.
  • Meningkatkan penanganan skema JSON dengan melakukan refactoring menggunakan representasi internal common_schema.
  • Memisahkan parser obrolan khusus ke dalam common/parsers dan menambahkan pencatatan JSONL terstruktur melalui --log-jsonl.
  • Memperbaiki alokasi cache KV konteks MTP untuk model DeepSeek2, GLM-MoE, dan model terkait.
  • Memperbaiki normalisasi GDN dari max menjadi rsqrt untuk model Qwen/Kimi/GLM yang terpengaruh.

Rilis ini memungkinkan menjalankan arsitektur model baru dan meningkatkan stabilitas melalui normalisasi yang dikoreksi, alokasi cache, dan manajemen proses anak server.