Proyek llama.cpp telah merilis versi 0.1.2, yang mencakup sinkronisasi dengan ggml (ditingkatkan ke 0.20.2) serta beberapa pembaruan pada komponen server dan UI.

  • CUDA: MMVQ nwarps=8 untuk bs=1 pada model padat di DGX Spark.
  • mtmd: gunakan sha256 untuk hashing input.
  • vocab: dukungan skor tokenizer bilangan bulat.
  • mtmd: lewati thumbnail untuk gambar LFM2 non-tiled.
  • server: simpan potongan mtmd yang diproses sebagai placeholder.
  • ui: terapkan urutan anggota enum secara alfabetis dan refactor penamaan Alat Bawaan.

Rilis ini juga menangani pembersihan build untuk xcframework + cmake serta memperbarui proses CI untuk generasi pra-rilis.