llama.cpp v0.6.0 memperkenalkan API batch ekstensi llama_batch_ext baru untuk input token dan embedding campuran, serta dukungan untuk model hibrida GLM-5.3-Flash 320B dan model keputusan Clef.

  • API llama_batch_ext baru mendukung embedding keadaan per-token untuk model MTP dan deepstack.
  • Qwen4Exp kini menawarkan dukungan berkualitas tinggi dengan decoding spekulatif MTP, memberikan percepatan dekoder sekitar 1.5x pada DGX Spark.
  • API server /v1/systemone baru mendukung lima model keputusan: laya, julia-1, lev, openjev, dan kev.
  • Metal mendapatkan kernel flash attention tensor-API untuk KV F16 dan kernel mat-mul MMA hingga 3x lebih cepat pada GPU Apple.
  • Web UI menerima pembaruan besar dengan lapisan data Hugging Face Hub dan pipa unduhan model.

Rilis ini memperluas kemampuan llama.cpp untuk pemrosesan multimodal, kinerja decoding spekulatif, dan integrasi model keputusan.