llama.cpp 0.3.0 memperkenalkan dukungan untuk model multimodal dots3-note dengan jenis cache KV DSA-ISWA baru, serta dukungan prediksi multi-token (MTP) untuk GLM-4.5-Air. Rilis ini juga menambahkan kemampuan tensor-split untuk DeepSeek 4 dan memperbaiki masalah rollback multi-sekuens.

  • ggml ditingkatkan ke v0.22.0, menambahkan dukungan tensor-split ke meta-backend dan kernel Metal per-op dengan kompilasi paralel.
  • mtmd mendapatkan dukungan visi/audio dots3-note, dekoding WebP melalui ffmpeg, dan algoritma resize yang akurat seperti Pillow.
  • DeepSeek 4 menerima mode tensor-split melalui flag `-sm tensor` serta perbaikan untuk rollback dengan beberapa sekuens.
  • Server menambahkan tombol debug `LLAMA_SERVER_SLOTS_N_DIFF`, sementara antarmuka web mendapatkan navigasi obrolan berbasis tab.

Pembaruan ini memperluas kemampuan multimodal llama.cpp dan meningkatkan kinerja serta stabilitas untuk arsitektur model tertentu seperti DeepSeek 4 dan GLM-4.5-Air.