Le projet llama.cpp a publié la version b10199, introduisant de nouvelles capacités dans son composant serveur. La mise à jour principale permet au serveur de prendre en charge les embeddings pour générer le prochain token, en ajoutant spécifiquement le support des embeddings des tokens échantillonnés.

  • Le serveur prend désormais en charge la génération d'embeddings pour les tokens échantillonnés afin de faciliter les flux de travail de prédiction du prochain token.
  • Une correction a été appliquée au destructeur ~server_batch().
  • Les compilations macOS Apple Silicon (arm64) avec KleidiAI sont désactivées dans cette version.
  • Des binaires précompilés sont disponibles pour Linux, Windows, Android et macOS via les backends CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL et OpenCL.

Cette mise à jour permet aux utilisateurs exploitant le serveur llama.cpp d'accéder directement aux embeddings des tokens pendant la génération, ce qui est utile pour les applications nécessitant des représentations vectorielles des tokens de sortie.