llama.cpp versi 0.4.0 memperkenalkan dukungan arsitektur awal untuk model Qwen3.8-Flash-Next dan NVIDIA Nemotron-3-Puzzle-75B-A9B, bersamaan dengan peningkatan pustaka ggml mendasar ke versi 0.23.0.

  • Menambahkan pembacaan tensor malas sesuai permintaan dan batas konteks server per slot.
  • Memperbarui ggml ke 0.23.0 dengan perhatian flash jarang dan dukungan transportasi Apple RDMA.
  • Memperkenalkan opsi input video, pencarian riwayat n-gram, dan batas RAM untuk kuantizer.
  • Mengaktifkan `preserve_reasoning` secara default di server dan meningkatkan helper tokenisasi multimodal.

Perubahan ini memperluas kompatibilitas model dan memberikan pengembang kontrol yang lebih halus atas penggunaan memori dan alokasi sumber daya server.