Proyek llama.cpp telah merilis versi b10199, memperkenalkan kemampuan baru pada komponen servernya. Pembaruan utama memungkinkan server mendukung embedding untuk menghasilkan token berikutnya, secara khusus menambahkan dukungan untuk embedding dari token yang disampling.
- Server sekarang mendukung generasi embedding untuk token yang disampling guna memfasilitasi alur kerja prediksi token berikutnya.
- Sebuah perbaikan diterapkan pada destructor ~server_batch().
- Build macOS Apple Silicon (arm64) dengan KleidiAI dinonaktifkan dalam rilis ini.
- Binari pra-bangun tersedia untuk Linux, Windows, Android, dan macOS di seluruh backend CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL, dan OpenCL.
Pembaruan ini memungkinkan pengguna yang memanfaatkan server llama.cpp untuk mengakses embedding token secara langsung selama generasi, yang berguna untuk aplikasi yang memerlukan representasi vektor dari token keluaran.